论文
重新审视 Agent Harness 自动优化的评估方法
Rethinking the Evaluation of Harness Evolution for Agents
摘要
我们重新审视大语言模型智能体的 Harness 自动优化评估。现有方法利用单元测试用例搜索 Harness 配置,再在同一个公开基准上报告最终表现。这种评测方式存在两个根本问题。首先,Harness 自动优化本身就是一个反复搜索的过程:根据任务反馈评估并修改候选方案。因此,需要在相近的反馈次数和推理预算下,将它与简单的任务级搜索方法比较,判断收益究竟来自更好的 Harness 设计,还是来自额外搜索。其次,搜索和最终评测使用同一套基准,报告的收益可能来自对这套任务的过度适配。 为解决这些问题,我们在相近的反馈次数和推理预算下,将 Harness 自动优化与简单的测试时扩展及发现方法进行比较;同时,在未参与优化的任务上测试优化后的 Harness,检查改进能否推广到新任务。使用 GPT-5.4 和 Claude Opus 4.6 在 Terminal-Bench 2.1 上的实验显示,Harness 自动优化未稳定优于简单的测试时扩展方法,在新任务上的改进也有限。这些结果对所测自动优化方法的有效性提出了质疑,并表明自动化 Harness 设计需要更公平的评测方法和基准。代码见 https://github.com/rethinking-harness-evolution。
