论文

WEFT:通用Agent的扩展工具使用后训练

WEFT: Scaling Tool-Use Post-Training for General-Purpose Agents

模型训练智能体系统强化学习Agent HarnessAgentic RL

摘要

最近扩展工具使用后训练的努力主要集中在可执行环境的综合上,这仅构成更广泛的 Agentic 交互系统的一个组件,该系统包括环境、任务、Agent Harness和评估器。然而,单独扩展环境并不能保证模型性能得到相应的提升,因为可靠的学习信号取决于 Agentic 交互系统所有组件之间的连贯交互。为了解决这个问题,我们引入了WEFT(工具使用后训练的整体系统进化),它将可扩展的agentic交互系统构建、执行驱动的自我进化和稳定的后训练结合起来。 WEFT 跨环境广度、任务复杂性和交互多样性扩展了 Agentic 交互系统构建。执行驱动的自我进化迭代地使用执行跟踪和状态证据来归因故障并修改负责的组件,并通过新的rollout来评估更改并为后续的进化轮次提供证据。为了实现大规模稳定的后训练,WEFT 解决了优化和执行可靠性问题:前缀保留采样保留了经过验证的进度,原子轮信用分配本地化了学习信号,而 MegaMCP 在共享工具服务上的并发rollout中保持隔离的、可恢复的状态。跨各种模型和基准的大量实验证明了 WEFT 对于工具使用后训练的有效性。 WEFT-8B 和 WEFT-14B 优于 BFCL V4、$τ^2$-Bench 和 Claw-Eval 上所有评估的相同规模环境缩放基线。特别是,WEFT-14B 比 Agent-World-14B 提高了 6.41、2.23 和 12.27 个百分点。 WEFT-35B-A3B 进一步将这些成果扩展到更具挑战性的长期工作流程基准,包括 Toolathlon-Verified 和 AutomationBench。