论文

配对难度很重要:重新思考配对大语言模型作为评审的评估和一致性

Pair Difficulty Matters: Rethinking Pairwise LLM-as-a-Judge Evaluation and Consistency

模型评测评测方法与指标

摘要

大语言模型评审广泛用于通过成对比较对文本和文本生成系统进行排名,其可靠性通常通过三个代理进行评估:位置偏差、传递性和成对一致性(自标记或人工标记)。由于这些代理因素推动了评审的选择和基准测试,大量文献报道评审在这些代理因素上表现不佳,因此可能会导致从业者远离其他有能力的评估者。我们认为这种评估具有误导性。在成对聚合的 Bradley-Terry 几何下,每个代理都由紧密的排名差距对主导,其中不一致是信息理论上预期的,并且单个判决对聚合排名贡献不大;远间隙对携带排名信号,但几乎不移动代理。我们形式化了这一论点,并在受控模拟和两个人工评级的语料库中验证了它:代理与黄金的排名准确性只有微弱的相关性,并且它们的预测成分集中在远差距状态。因此,应该根据排名差距条件指标(最好是根据人类排名)对评审进行评估。代码为https://github.com/brunobrocai/PairDifficulty.