论文

性能优化基准是否可靠地测量 编码智能体?

Are Performance-Optimization Benchmarks Reliably Measuring Coding Agents?

模型评测评测方法与指标

摘要

存储库级性能优化基准(例如 GSO、SWE-Perf 和 SWE-fficiency)通过将补丁应用到真实存储库并将运行时与未优化的基准和官方参考补丁进行比较来评估 编码智能体。他们的排行榜分数越来越多地被用作编码代理进展的证据,但这些分数可能会混淆运行时的不稳定性、特定于基准的评分规则以及至少一项公开提交已经解决了多少任务。我们通过三个基准审核这些问题。首先,我们在四种常见类型的 Google Cloud 机器上重放 740 个代码优化任务的官方参考补丁。大多数基准测试任务都可以重放,但其参考补丁在每次跨机重放中仅满足 39/102 GSO 任务、11/140 SWE-Perf 任务和 411/498 SWE-fficiency 任务的原始基准有效性规则; SWE-Perf 特别脆弱,因为许多参考补丁产生接近于零的运行时更改。其次,我们表明公众提交排名在很大程度上取决于基准评分规则。在 GSO 和 SWE-fficiency 共享的 8 项公开提交中,官方排名在 28 项成对提交比较中的 9 项存在分歧,并且 SWE-fficiency 的排行榜评分规则为最差的 10 项任务分配了 58.5%-82.8% 的过高分数权重。第三,查看每个任务的 10 个公开提交,我们发现至少有一个提交在 85.3% (384/450) 的重播有效 GSO 和 SWE 效率任务上匹配或击败了参考补丁,并在 99.8% (449/450) 上击败了未优化的基本代码。我们的研究通过识别具有更可靠绩效信号的任务、量化每个任务的分数贡献以及揭示总排名隐藏的剩余绩效差距来补充排行榜分数。