论文

用于AgentHarness优化的自我改进分支的混合

Mixture of Self-Improving Branches For Agent Harness Optimization

智能体系统Agent Harness智能体自我改进

摘要

Harness优化为递归自我改进 (RSI) 提供了实用的设置,其中Agent生成的修改通过执行反馈通知后续更改。最近的工作(例如 Meta-Harness)通过迭代代码生成和评估来实现此过程,但保留了固定的开发集和提案策略。这些约束沿着单一搜索轨迹引导演化,增加了收敛到局部最优的风险。我们通过将搜索组织到具有不断发展的开发子集和提案策略的分支中,使改进过程本身具有适应性。每个分支保留由比其他分支更多的主导Harness解决的开发案例,丢弃所有分支中每个主导Harness解决的案例,并使用自己的搜索历史修改其提案策略。为了部署生成的互补工具,我们建议使用一个路由器,在执行之前为每个新输入选择一个开发选定的分支头。在数学推理和 Agentic 编码基准测试中,我们的系统在奥林匹克级数学推理上比 Meta-Harness 实现了 34.8% 的相对改进,在 Terminal-Bench 2.0 上实现了 11.6%,在 SWE-bench Lite 上实现了 3.8%,且Harness选择和路由器配置仅基于开发数据。这些结果表明,不断发展的分支目标和提案策略可以产生互补的工具,路由器可以在无需访问测试结果的情况下结合其优势。