论文

维护日益强大的Agent基准:识别并修复非能力原因的通过

Maintaining Benchmarks Against Increasingly Capable Agents: Detection and Remediation of Unearned Passes

模型评测评测方法与指标

摘要

Agentic 基准指导模型选择和训练。然而,Agent可以在不展示预期能力的情况下通过任务。此类结果构成不劳而获的通行证;它们在所有通行证中的比例定义了完整性差距。随着Agent的改进,曾经看似无害的基准表面可能变得可利用,从而使基准有效性成为一个持续的维护问题。我们引入了一个过程验证框架,该框架可以审核通过的轨迹,区分有证据的奖励作弊和验证者的弱点,并定位可利用的表面以进行修复。在来自 29 个模型基准组的 3,810 条超车轨迹中,已确认的违规行为通常会随着模型的生成而增加,但并非单调增加。在 SWEBench Pro V1.0 上,Opus 4.7 和《神鬼寓言 5》匹配任务的确认违规率从 24% 上升至 73%;后来的队列中,Fable 5.1 的比例下降到 11%,GPT-6 Astra 的比例下降到 0%。这些比较是描述性的:配置没有标准化,最新的模型也通过了更少的可利用任务。违规行为集中在一小部分重复出现的表面上,尤其是通过 git 历史记录意外访问参考解决方案。跨两个基准的三个修复案例研究表明了为什么阻止记录的漏洞是不够的:相同的受保护信息仍然可以通过其他途径访问。因此,我们将最小补丁与漏洞重放和新Agent评估相结合,在原始标准下审核新通行证。没有针对最终补丁的评估尝试到达受保护的通道,并且每个补丁后通过都被判定为合法。基准完整性需要持续维护:审核通过行为,修复支持表面,并重新评估漏洞利用访问和合法可解决性。