论文
正确看起来更好:成对比较揭示准确率排名
Correct Looks Better: Pairwise Comparisons Reveal Accuracy Rankings
摘要
成对比较与 Elo 等聚合方法相结合已成为评估生成模型的核心,但人们仍然担心它们会奖励肤浅的风格线索或表现出判断偏见。从更积极的角度来看,我们表明,当可以进行比较时,成对比较的模型排名与基于真实情况的准确性排名非常一致。通过将五个著名的基准转换为自由形式的生成评估,我们发现 Elo 排名与准确性排名的 Spearman 相关性达到 0.9 以上,并且在判断较弱时大大优于直接评估。此外,风格和判断偏差对模型排名的影响很小,尽管大多数判断都是在两个候选答案都正确(或不正确)的配对上进行的。在这样的配对中,我们发现最终答案(回声)后的重复是法官偏好的因果驱动因素。
