论文

抛硬币法官? LLM 法官评估的可靠性和偏差

The Coin Flip Judge? Reliability and Bias in LLM-as-a-Judge Evaluation

模型评测评测方法与指标

摘要

LLM-as-a-Judge 现在广泛用于对模型输出进行排名、训练奖励模型以及填充公共排行榜,但其运行间可靠性仍然没有得到充分表征。我们使用两个 OpenAI 判断模型(GPT-4o-mini 和 GPT-4.1-mini)研究了对跨越 10 个类别的 29 项任务的重复相同评估,每个问题进行 50 次配对试验和 50 次逐点试验,并辅以温度和提示敏感性消融。在法官中,成对偏好的翻转率平均为 13.6%,其中 28% 的问题翻转率超过 20%,其中一个问题达到 56%。 GPT-4o-mini 还表现出显着的第一位置偏差(72% A 多数,p = 0.024)。与此同时,平均逐点分数差距很小(10 分制为 0.19--0.36),并且总体上并不具有统计显着性,从而产生了成对的逐点差距:即使法官自己的标量分数几乎没有提供有意义的质量差异的证据,他们也经常选择获胜者。除了法官内部的不稳定之外,法官间的一致性只有 76% ($κ= 0.51$),语义等效的提示模板改变了 25% 测试案例中的大多数结果,确定性解码减少但没有消除不一致。可靠性曲线分析表明,在我们的数据集中,需要 11 次重复试验才能获得多数票,才能以平均 95% 的概率恢复 50 次试验的参考判决,对于高方差问题则上升到 15 次。这些发现表明,单次试验 LLM 的判断对于高风险评估来说往往噪音太大,而多试验聚合、位置随机化和明确的不确定性报告应该成为标准做法。由于两位法官都来自同一提供商,因此跨提供商复制仍然是重要的下一步。