论文
TRACE:能力定向的智能体训练
TRACE: Capability-Targeted Agentic Training
摘要
部署在代理环境中的大语言模型 (LLM) 必须在不同的任务实例中运用多种功能,其中一种功能在轨迹中执行一个或多个操作,这些操作对于成功解决环境中的任务子集是必需的。许多现有方法要么依赖于合成训练数据,而不是针对目标环境中模型的实际能力缺陷,要么直接在目标环境上进行训练,其中模型需要隐式学习跨任务的能力。我们引入了 TRACE(将经常出现的代理故障转变为以能力为目标的训练环境),这是一种用于特定环境代理自我改进的端到端系统。 TRACE 对比成功和失败的轨迹,自动识别缺乏的能力,为每个轨迹合成一个有针对性的训练环境,奖励是否行使了该能力,并通过 RL 在每个合成环境上训练 LoRA 适配器,在推理时路由到相关适配器。根据经验,TRACE 可以在不同的环境中进行推广,在 $\tau^2$-bench(客户服务)上比基本代理提高了 +14.1 分,在 ToolSandbox(工具使用)上提高了 +7 分,分别比最强基线提高了 +7.4 分和 +4 分。在推出相同数量的情况下,TRACE 的扩展效率比基线更高,在 $\tau^2$ 基准上比 GRPO 和 GEPA 分别高出 +9.2 和 +7.4 个点。
