论文

当法官发生变化时,衡量标准也会发生变化:审核 LLM 作为法官的可靠性

When the Judge Changes, So Does the Measurement: Auditing LLM-as-Judge Reliability

模型评测评测方法与指标

摘要

即使候选人的回答保持固定,LLM 作为评委的分数也可能会发生变化,这仅仅是因为评估者发生了变化。我们将这种评估者替换的模糊性视为测量有效性问题。在四个判断数据集上,我们比较了实践中可用的两种升级路径:将 Qwen3 密集判断从 1.7B 参数扩展到 32B 参数,以及跨 MiniMax M2-M2.7 发布的 API 进行移动。主要模式是判断升级不可互换:只有 Qwen3 1.7B 到 4B 提供强大的相邻增益,而 MiniMax 相邻版本则不能。更强的法官会减少但不会消除立场和冗长的偏见。当错误相关时,重复样本陪审团几乎不会增加任何内容。结构化辩论可以极大地改变决策,但如果没有解析器和后备日志,这些转变就不能归因于深思熟虑。我们认为,LLM 作为法官的报告应包括数据集切片、偏差探测、错误依赖性估计和协议审计跟踪。