论文

没有有效性的可靠性:对 LLM 法官模型在一致性、一致性和偏差方面的系统性、大规模评估

Reliability without Validity: A Systematic, Large-Scale Evaluation of LLM-as-a-Judge Models Across Agreement, Consistency, and Bias

模型评测评测方法与指标

摘要

LLM-as-a-Judge 已成为语言模型的主导评估范式,但实践中的判断验证依赖于精确匹配一致性,这是一种不纠正机会并系统性夸大判别能力的指标。我们对 LLM-as-a-Judge 进行了迄今为止最大规模的系统评估:来自 MT-Bench、JudgeBench 和 RewardBench 的 9 个提供商的 21 名法官,根据三种协议(一致性、一致性、偏见审计)进行了超过 118 次运行和大约 541,000 个个人判断的评估。出现了四项结果,在整个队列中保持一致,包括 2026 年 4 月的前沿:完全匹配和科恩的 kappa 之间的 kappa 紧缩是普遍存在的(MT-Bench 上的 33--41 pp),法官排名在基准上最多移动 14 个位置,在两名生产部署的法官中,高测试-重测可靠性 (>0.95) 与严重的位置偏差 (>0.10) 共存(实例化了一致性——偏差悖论),并且在单个成对标题下,我们的队列中的冗长偏差很小(<0.011)。我们将它们提炼成最小可行验证协议。