论文
你需要的最后一个Harness
The Last Harness You'll Ever Build
摘要
AI智能体越来越多地被部署在复杂的、领域特定的工作流上——操作需要数十次点击和表单填写的企业Web应用,编排跨越搜索、抽取与综合的多步研究流水线,在不熟悉的仓库间自动化代码审查,以及处理需要精细领域知识的客户升级问题。每个新任务领域都需要费力的、专家驱动的harness工程:设计让基础模型有效发挥作用的提示、工具、编排逻辑与评估标准。我们提出一个自动化这一过程的两级框架。在第一级,Harness Evolution Loop针对单一任务优化工作智能体的harness $\mathcal{H}$:工作智能体 $W_{\mathcal{H}}$ 执行任务,评估智能体 $V$ 以对抗方式诊断失败并为表现打分,演化智能体 $E$ 基于先前尝试的完整历史修改harness。在第二级,Meta-Evolution Loop跨多样任务优化演化蓝图 $\Lambda = (W_{\mathcal{H}}, \mathcal{H}^{(0)}, V, E)$ 本身,学得一个能够使harness在任何新任务上快速收敛的蓝图 $\Lambda^{(\text{best})}$——从而让智能体适配新领域完全不需要人工harness工程。我们将与元学习的对应关系形式化,并给出两种算法。该框架将人工harness工程转变为自动化harness工程,并更进一步——将自动化本身的设计也自动化。
