论文

正确看起来更好:成对比较揭示准确率排名

Correct Looks Better: Pairwise Comparisons Reveal Accuracy Rankings

模型评测评测方法与指标

摘要

成对比较与 Elo 等聚合方法相结合已成为评估生成模型的核心,但人们仍然担心它们会奖励肤浅的风格线索或表现出判断偏见。从更积极的角度来看,我们表明,当可以进行比较时,成对比较的模型排名与基于真实情况的准确性排名非常一致。通过将五个著名的基准转换为自由形式的生成评估,我们发现 Elo 排名与准确性排名的 Spearman 相关性达到 0.9 以上,并且在判断较弱时大大优于直接评估。此外,风格和判断偏差对模型排名的影响很小,尽管大多数判断都是在两个候选答案都正确(或不正确)的配对上进行的。在这样的配对中,我们发现最终答案(回声)后的重复是法官偏好的因果驱动因素。

正确看起来更好:成对比较揭示准确率排名:论文配图
(a) 排名相关性 (b) 分数相关性 图 9:Bradley-Terry 与简单 QA 上的直接评判 我们在基准上的“最强模型”(o3,59.3% acc)、“中间模型”(gpt-oss-120b,8.8% acc)和基准上的“最弱模型”(gpt-oss-20b,4.9% acc)之间改变我们的评估器。虽然这两种方法在使用强模型时具有可比性,但 Bradley-Terry 在较弱模型设置中明显占主导地位。