论文

VERSE:验证式自进化智能体Harness优化器

VERSE: Verified Self-Evolving Optimizer for Agent Harnesses

智能体系统智能体自我改进递归自我改进(RSI)

摘要

Harness进化改进LLM智能体的提示、工具与工作流,而优化器自身的工具与流程往往保持固定。我们研究优化器能否通过同时改进其诊断失败、开发编辑与测试效果的方式更有效地改进另一个智能体。两个观察引导设计:在受控研究中,无执行验证时优化器自进化无法提升性能,而有验证时取得该研究最佳结果;跨五个执行器,自进化优化器会自建失败分析、验证、训练审计与工作流控制工具。据此我们提出VERSE——面向智能体Harness的验证式自进化优化器:让优化器在提交前测试草稿编辑、重放失败并扰动可疑步骤,跨轮追踪修复与回归;利用该反馈,优化器同时修订执行器Harness与自身的提示、技能、工具、钩子与笔记,优化器与执行器模型权重保持固定。在与训练/验证/测试不相交任务的共享协议下,VERSE在留出SWE-rebench任务及更新的五种语言分布外任务上改进全部四个受评Harness优化器;其验证选优的最佳Harness分别达42.3%与37.7%准确率,对最强基线的39.2%与29.3%。代码/项目页:https://github.com/wzekai/VERSE。