论文
CoTrace:匹配Harness与模型协同改进的训练轨迹
CoTrace: Data Recipes for Training Terminal Agents with Harness-Model Co-Evolution
摘要
终端Agent的能力共同取决于模型权重和格式化提示、绑定工具和处理错误恢复的运行时工具。现有的Harness模型协同进化方法改进了这两个组件,但通常将Harness搜索过程中产生的轨迹视为无差别的重播缓冲区。这种做法忽略了轨迹对于模型训练的价值取决于生成轨迹的工具。为了系统地分析这个接口,我们建立了一个交替共同进化框架,该框架通过组件明智的升级决策将利用搜索和策略训练解耦。在此框架内,我们引入了 CoTrace,这是一种可感知Harness的数据配方,可显式管理轨迹路由、来源匹配和课程刷新。在 CoTrace 下,重复出现的执行失败会引导工具合成,而策略训练则严格以与监督微调 (SFT) 所采用的运行时相匹配的经过验证的部署或强化学习 (RL) 的新在线交互为条件。在 Tmax 晋级分成中,CoTrace 晋级 Qwen3.5-9B 在监督微调下解决了从 78 到 88 的任务,而在线强化变体达到了 90。具体来说,紧凑的Harness匹配语料库以比兄弟Harness中汇集的更大的语料库低得多的计算量产生稳定的模型增益。此外,对 Terminal-Bench 2.1 和 SWE-bench Lite 的评估表明,分布外传输从根本上取决于Harness兼容性,其中保持训练和评估运行时之间的一致性可以防止在外国支架下观察到的程序执行故障。
