论文
谁来担任法官很重要:衡量大语言模型法官小组中家庭条件的偏好
Who Judges Matters: Measuring Family-Conditioned Preference in LLM-as-Judge Panels
摘要
法官是谁会影响大语言模型法官的结果,但在不将其与候选人质量混淆的情况下衡量这种影响是很困难的。我们以完全交叉的成对设计和 9,312 个判断研究了四个开放权重家族(Llama 3.1、Qwen 2.5、Gemma 2 和 Yi 1.5)。常见的每个家庭统计数据与候选人质量强烈混杂,并且与 Bradley-Terry 能力相关(r = 0.95)。我们推导出一个修正的估计量,该估计量固定候选家庭并比较法官。所有四个家庭均表现出正向同系提升(3.4-8.4 个百分点),全局 FPS 为 0.067(95% CI [0.053, 0.084],排列 p = 0.0002)。该效果仍然受到基于面板的质量控制、独立的人类共识锚点和 float16 判断复制的影响。法官端似然与效果密切相关:增加似然优势使受控系数降低了 61%,我们将其视为描述性衰减而不是因果中介。位置是一种单独的故障模式。在整个面板中,55.4% 的 AB/BA 对发生反转,并且超过 50% 的反转与简单的独立内容噪声模型不兼容。相对于家庭平衡参考,小组组成改变了成对结果的 18.5%。完整的可重复性档案已准备好供公开发布。