论文

全配对Agent比较不能把配对数当独立样本数

When Pair Count Is Not the Sample Size: What All-Pairs Agent Comparisons Estimate

模型评测评测方法与指标

摘要

当Agent基准比较每对排行榜条目时,比较的数量可能看起来比它们背后的独立证据大得多:A 与 B 以及 A 与 C 都重用 A。这种重用是否影响推理取决于分析的目的是描述什么。如果棋盘及其结果是固定的,则所有对均值是这些条目的精确汇总,并且任何间隔都必须来自另一个声明的随机性来源。如果条目被视为来自未来配置总体的独立同分布,并且对规则是规则且非简并的,则相同的均值是二阶 U 统计量,其一阶不确定性取决于配置的数量,而不是对的数量。我们使用近关系作为运行示例,但当它们的正则性条件成立时,这种区别扩展到其他对称对摘要。我们使用固定的 SWE-bench Verified 快照和已知事实的精确二进制模型来检查这两种解释。在 SWE-bench 上,考虑共享配置的间隔比将配对视为独立的配对独立同分布参考宽两倍多。在精确模型中,当边共享端点时,对独立同分布覆盖率远低于标称水平,但对于匹配的独立边仍接近标称水平。另外两个固定排行榜的结果表明,准确的摘要还取决于包含哪些对以及它们的加权方式。因此,全对分析必须说明什么是固定的、采样的内容以及它如何处理共享条目和对聚合。