论文

编码代理已经融合:为什么 SWE 基准排行榜不能再排序其热门条目,以及应该衡量什么

Coding Agents Have Converged: Why the SWE-bench Leaderboard Can No Longer Order Its Top Entries, and What to Measure Instead

智能体系统Agent任务评测

摘要

编码代理排行榜上的微小差异通常被视为系统的排序。我们使用跨四个分区的 254 个 SWE 基准提交内容来审核已发布的结论是否支持这种解读,而无需运行模型。在已验证时,前两个条目各自解析 500 个实例中的 396 个。前十名共有 285 个成功案例和 51 个失败案例,剩下 164 个结果不同的实例。前沿解决方案集的嵌套中位数为 0.935,而分数隐含基线为 0.774,表明强烈共享成功。分数还取决于评估的模型-支架对:观察到的模型内支架范围达到 29.8 个百分点,而前 30 名的差距为 8.8 个百分点。九个细胞平均相互作用测试中的六个在霍尔姆校正后仍然显着,尽管这种观察设计没有识别因果支架效应。精确配对的 McNemar 测试在 alpha=0.05 时没有将 29 个相邻的已验证前 30 对分开,而较大的测试分割将 23 个配对中的 14 个分开。规定的基于领导者的规则产生三个描述性层,或者在 Holm 校正后产生两个描述性层;不拒绝并不建立等价。我们发布了分区和五步审计协议,用于分析共享结果、测试配对差异、报告分组敏感性并估计解决方案所需的实例预算。结果促使报告特定于比较集的分辨率和模型支架的来源,而不是将小的总体差距解释为已建立的排名差异。