论文

AgentBrew:从真实原始轨迹离线学习工具使用

AgentBrew: Offline Tool-Use Agent Learning from Raw Real-World Trajectories

模型训练智能体系统监督微调与指令调优智能体互操作协议MCP

摘要

基于 LLM 的智能体越来越多地通过工具使用 API 部署在现实世界的应用程序中,但针对特定环境训练它们仍然非常困难:现实世界的应用程序不提供预定义的任务或验证器,没有忠实的模拟器,并且大规模环境交互的预算有限。在本文中,我们提出了 AgentBrew,这是一种离线训练框架,可以从单批原始交互轨迹中学习有效的工具使用策略,而无需任务验证器或迭代的在线策略采样。智能体首先探索目标环境以收集未经质量过滤的原始轨迹语料库。为了从这个嘈杂的语料库中提取训练信号,回顾性任务推理根据其实际结果为每个轨迹重建对齐的指令,而基于 PMI 的贡献分配通过逐点互信息(PMI)将轨迹的有关推断指令的总信息分解为可相加的逐动作贡献。这些贡献用于加权策略训练目标,提高信息量丰富动作的权重,同时抑制无效行动。在三个真实的 MCP 应用程序(GitHub、Notion、PostgreSQL)上,AgentBrew 将 Qwen3-32B 平均提高了 +8.7 Acc / +9.7 Score,超越了 Qwen3-235B (+2.3 / +4.4) 并优于拒绝采样 (+5.9 / +10.3)。这些结果表明,细粒度的离线学习可以从基于过滤的方法会丢弃的原始轨迹中恢复有用的监督。该代码可在文中链接 获取

AgentBrew:从真实原始轨迹离线学习工具使用:论文配图
图 1:左:轨迹级过滤会丢弃未能完成原始任务的整个轨迹,从而丢失潜在有用的操作。右:AgentBrew 为每个轨迹推断出一个更好的对齐任务,并在推断的任务下分配每个动作的积分,使整个语料库能够为训练做出贡献。