论文

Harness-R1:从Agent失效轨迹学习编辑可执行运行时Harness

Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories

模型训练智能体系统强化学习Agent HarnessAgentic RL

摘要

围绕大语言模型构建的代理在部署过程中不断积累交互轨迹,但其行为通常保持不变。除了更新模型权重,这些轨迹还可以改善代理构建的上下文、调解工具、验证行动和恢复执行。我们引入了Harness-R1,这是我们知识库中第一个使现有可执行运行时在失败条件下、生命周期内进行编辑的学习能力。它通过在线强化学习训练专门的代理工程师,使其编辑优化以实现实际任务的成功,而不是由固定的编辑器提出的。另有一个9B工程师将目标代理失败转换为验证的可执行补丁;冻结后的目标代理的重新运行提供奖励,因此训练仅更新工程师。冷启动的监督微调初始化了这个编辑策略,然后在组相对策略优化下进行在线训练。在WebShop、ALFWorld和DBBench上,Harness-R1将基本Qwen3.5-9B的成功率从44.3%提高到53.6%(+9.3个百分点)。在直接目标代理微调后,一个针对目标代理的特定工程师将平均成功率从59.2%提高到64.2%(+5.0个百分点)。因为这些改进在微调目标代理前后都有效,Harness-R1指向使代理工程师和目标代理协同进化。

Harness-R1:从Agent失效轨迹学习编辑可执行运行时Harness:论文配图
图2 :线束-R1概述。挖掘的目标故障成为证据捆绑包(左) ;线束工程师编写一个可执行补丁,该补丁在围绕冻结目标的运行时中编辑四个生命周期点(右) ;已补丁的目标重新运行相同的任务,并且由此产生的同一批次奖励仅通过冷启动SFT和GRPO (底部循环)培训工程师。有关循环、操作空间和生命周期钩子,请参阅方法部分。