论文

所有判决并不平等:重新思考LLM法官的可靠性

All Verdicts are Not Equal: Rethinking LLM Judge Reliability

模型评测评测方法与指标

摘要

LLM-as-a-Judge 是 NLP 评估的标准范式,但尽管它被广泛视为确定性的基本事实,但其系统可靠性仍然知之甚少。我们提供全面的可靠性审核,对四个基准、五种提示格式、两种演示顺序、三种采样温度和每种条件十次重复的六种前沿模型进行压力测试。我们的实证分析揭示了严重的漏洞:零温度下相同复制的判决会发生变化,位置顺序交换翻转了对挑战性任务的大多数判决,而最具确定性的法官通过微不足道地重复错误的判决来实现完美的一致性,只有 51% 的时间与地面事实一致。为了形式化这些多方面的故障模式,我们引入了可信判决率(T),这是一个统一的度量标准,用于捕获评估可再现、顺序不变和准确的联合概率。使用 T ,我们推导出位置偏差所施加的准确度的理论上限,并表明可靠性是特定于项目的,而不是 模型级别。最后,我们证明,从成对胜率转向整体评分标准比任何单一格式的提示干预更能提高可信度,为稳健的 NLP 评估提供了一个可行的框架。