论文
Harness-R1:从Agent失效轨迹学习编辑可执行运行时Harness
Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories
摘要
围绕大语言模型构建的代理在部署过程中不断积累交互轨迹,但其行为通常保持不变。除了更新模型权重,这些轨迹还可以改善代理构建的上下文、调解工具、验证行动和恢复执行。我们引入了Harness-R1,这是我们知识库中第一个使现有可执行运行时在失败条件下、生命周期内进行编辑的学习能力。它通过在线强化学习训练专门的代理工程师,使其编辑优化以实现实际任务的成功,而不是由固定的编辑器提出的。另有一个9B工程师将目标代理失败转换为验证的可执行补丁;冻结后的目标代理的重新运行提供奖励,因此训练仅更新工程师。冷启动的监督微调初始化了这个编辑策略,然后在组相对策略优化下进行在线训练。在WebShop、ALFWorld和DBBench上,Harness-R1将基本Qwen3.5-9B的成功率从44.3%提高到53.6%(+9.3个百分点)。在直接目标代理微调后,一个针对目标代理的特定工程师将平均成功率从59.2%提高到64.2%(+5.0个百分点)。因为这些改进在微调目标代理前后都有效,Harness-R1指向使代理工程师和目标代理协同进化。
