论文

Harness与模型共同演化:用同策略纠正缓解模仿失配

Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails

模型训练智能体系统监督微调与指令调优Agent Harness

摘要

智能体工具(系统提示、工具集、执行挂钩和模型周围的上下文管理支架)是智能体任务成功的关键决定因素。自动化Harness演化可以使较小的模型以前沿模型成本的一小部分来在特定领域的任务上表现良好。由于Harness和模型权重都会影响行为,因此我们询问如何将Harness进化和轻量级微调结合起来。在七个企业智能体任务中,我们首先使用较弱的模型开发一个工具,然后发现更强大的专家通常更有效地使用它,这表明专家监督可以缩小剩余的差距。然而,在进化的Harness下根据专家的完整轨迹训练较弱的模型会适得其反:在 Qwen3-Coder 和 Gemma 4 上,所有七项任务的性能都会下降 4 到 30 个点,尽管相同的程序在未进化的Harness下有所帮助。我们的分析表明,模仿可以转移知识并增加支架的使用,但会破坏模型与工具的匹配性:较弱的模型采用专家的规划策略,但没有执行能力,并且不再与围绕其本地规划风格演变的工具相匹配。因此,我们开发了一个由元级 MLE 智能体自动化的策略专家校正管道,该管道将较弱模型自身的采样轨迹中的失败回合定位,并要求专家仅重写该转弯。这保留了模型的规划风格,并结合了Harness进化和模型适应的收益。我们的结果确定并解决了Harness和权重更新之间的争用来源,从而为特定领域的企业任务的经济共同进化提供了保持兼容性的方法。