论文

代理Harness工程:可观察性驱动的编码代理Harness自动演化

Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses

智能体系统Agent Harness

摘要

现在,Harness是编码代理性能的核心,它调节模型与工具和执行环境的交互方式。然而,Harness工程仍然是一项手工工艺,因为自动化它面临着跨可编辑组件的异构操作空间、隐藏可操作信号的大量轨迹以及难以归因的编辑效果。我们引入代理Harness工程(AHE),这是一个闭环,通过三个匹配的可观察性支柱解决这些挑战:(1)组件可观察性为每个可编辑Harness组件提供文件级表示,因此操作空间是明确且可恢复的; (2) 经验可观察性将数百万个原始轨迹标记提炼成一个分层的、可钻取的证据语料库,供不断发展的智能体实际使用; (3) 决策可观察性将每次编辑与自我声明的预测配对,然后根据下一轮的任务级结果进行验证。这些支柱共同将每次编辑变成可证伪的合同,因此利用进化可以自主进行,而不会陷入反复试验。根据经验,十次 AHE 迭代将 Terminal-Bench 2 上的 pass@1 从 69.7% 提升到 77.0%,超过了人工设计的工具 Codex-CLI (71.9%) 以及自我进化基线 ACE 和 TF-GRPO。冻结的Harness无需重新进化即可转移:在 SWE-bench 验证上,它以比种子少 12% 的词元数取得了总体成功,而在 Terminal-Bench 2 上,它在三个替代模型系列中产生了 +5.1 至 +10.1pp 的跨系列增益,这表明进化的组件编码了一般工程经验,而不是特定于基准的调整。消融将增益定位于工具、中间件和长期记忆,而不是系统提示,这表明事实驾驭结构转移,而散文级策略则不然。