论文

VACE:代理模型和工具的验证门控交替协同进化

VACE: Validation-Gated Alternating Co-Evolution of Agent Models and Harnesses

智能体系统Agent Harness

摘要

语言模型Agent可以通过更新其模型权重或改进指导任务执行的工具来改进。这些组件是耦合的:权重更新改变模型使用Harness的方式,而Harness更新改变用于训练的轨迹。我们提出了 VACE(验证门控交替协同进化),它将 Agentic 强化学习与轨迹驱动的Harness细化交替使用。在每个 RL 阶段之后,VACE 会重复使用收集到的轨迹来提出Harness修订方案,并使用固定的更新模型来评估现任者和候选人。仅当后续训练能够提高验证性能时,候选者才会指导后续训练。借助 Qwen3.5-9B,VACE 在 OfficeQA 上实现了 45.26% 的测试准确率,在 AutomationBench 上实现了 75.19% 的平均部分信用分数,分别超过仅权重 RL 6.43 和 9.09 个百分点,以及非门控交替 4.59 和 6.95 个百分点。在 44 个工具提案中,有 17 个在更新的检查点降低了验证性能,并在后续 RL 训练之前被拒绝,这凸显了验证门控的重要性。