论文

Harness能修复什么?可见性、基线充分性和评估缺陷的预注册研究

What Does a Harness Repair? A Preregistered Study of Visibility, Baseline Adequacy and Evaluation Defects

智能体系统Agent任务评测

摘要

如果更改提高了分数,Harness搜索会保留对冻结模型周围的提示、推理开关、token预算或解析器的更改。这样的增益可能来自解析器之前无法读取的答案、较弱的比较或评估中的缺陷。我们预先注册了一项关于这些收益从何而来的研究,其中包括三个小模型、三个基准、复制和测试分区、一个 GEPA 搜索臂和一次注入一个的六个评估缺陷,并且我们报告了所有 47 个主要终点。关闭思维提高了 9 个模型基准单元中的 5 个相对于上限思维设置的准确性,并且在每个单元中,收益主要来自上限设置无法给出可读答案的问题。在 13 次比较中的 11 次中,思考设置并不比救援配置或四个 GEPA 选择的Harness更差,并且有两个型号输给了 GSM8K 上的救援。 GEPA 修复了其损坏的起点,但其选择的Harness中没有一个比思考设置更准确。服务引擎中的思考预算,还允许更长的答案,降低了截断并提高了 9 个单元格中的 6 个单元格的解析率。在 15 个可评估的缺陷模型对中的 6 个中,通过同一管道的复制再现了缺陷的失真,而不是揭示它。在 LongevityBench 多项选择任务中,只有寿命调整模型击败了最强的常量标签基线。