论文

你需要的最后一个Harness

The Last Harness You'll Ever Build

智能体系统Agent Harness智能体自我改进递归自我改进(RSI)

摘要

AI智能体越来越多地被部署在复杂的、领域特定的工作流上——操作需要数十次点击和表单填写的企业Web应用,编排跨越搜索、抽取与综合的多步研究流水线,在不熟悉的仓库间自动化代码审查,以及处理需要精细领域知识的客户升级问题。每个新任务领域都需要费力的、专家驱动的harness工程:设计让基础模型有效发挥作用的提示、工具、编排逻辑与评估标准。我们提出一个自动化这一过程的两级框架。在第一级,Harness Evolution Loop针对单一任务优化工作智能体的harness $\mathcal{H}$:工作智能体 $W_{\mathcal{H}}$ 执行任务,评估智能体 $V$ 以对抗方式诊断失败并为表现打分,演化智能体 $E$ 基于先前尝试的完整历史修改harness。在第二级,Meta-Evolution Loop跨多样任务优化演化蓝图 $\Lambda = (W_{\mathcal{H}}, \mathcal{H}^{(0)}, V, E)$ 本身,学得一个能够使harness在任何新任务上快速收敛的蓝图 $\Lambda^{(\text{best})}$——从而让智能体适配新领域完全不需要人工harness工程。我们将与元学习的对应关系形式化,并给出两种算法。该框架将人工harness工程转变为自动化harness工程,并更进一步——将自动化本身的设计也自动化。

你需要的最后一个Harness
图 1:系统架构。元进化循环(绿色,外部)通过在不同的训练任务 t 1 , t 2 , … , t n t_{1},t_{2},\dots,t_{n} 上运行 Harness Evolution Loop(蓝色,内部)来优化进化协议 Λ \Lambda 。每个内循环实例通过执行(Worker)、评估(Evaluator)和代码修改(Evolution Agent)的迭代循环来优化单个任务的工作工具 ℋ \mathcal{H}。元进化代理汇总所有任务的分数并修改进化协议,将更新的协议反馈给下一轮。输出是性能最佳的进化协议 Λ ( best ) \Lambda^{(\text{best})} 。