论文

什么时候可以对 LLM 法官进行除偏?可识别性限制、测试和 Top-k 排名设计

When Can You Debias an LLM Judge? Identifiability Limits, a Test, and Designs for Top-k Ranking

模型评测评测方法与指标

摘要

大语言模型 (LLM) 越来越多地用作廉价、可扩展的判断器,成对比较候选输出。由于此类法官更喜欢冗长或格式良好的答案,因此自然的解决方案是将偏差协变量添加到 Bradley-Terry 模型中并估计偏差。我们证明这不能像宣传的那样起作用:通过成对比较,质量/偏差分裂是\emph{未识别},并且失败是精确的——在$48$的真实判断池中,系数的轮廓可能性平坦至$\mathbf{0.0000}$\textbf{nats},并且缩放比较$26\times$什么也买不到。 “去偏”分数是由先验选择的,而不是从数据中恢复的。因此,我们的贡献不是更好的估计器,而是 \emph{当基于先验的校正合理时}的表征,加上在不合理时提供缺失信息的设计。先验编码的假设——质量是与协变量不相关的先验——只有在 $\mathrm{corr}(θ,x)$ 保持在交叉点以下(依赖于配置,$0.22$--$0.60$)时才有价值,这就是为什么相同的模型在 LLMBar 上有所帮助,但在 SummEval 和 Nectar 上却受到损害。我们给出两个逃逸:一个 \textbf{可信锚门},它决定每个(判断,协变量,任务)(在 $K\ge10$ 锚点处的 $6{,}000$ 决策中没有 false 启用,我们的样本边界在 $\le6\%$ 处的速率),以及 \textbf{配对渲染设计}。在 15 个真实的 LLM 法官中,偏见是异质的并且依赖于能力:校正将 5 个有偏见但有能力的廉价法官的 \topk{} 召回率提高了 $0.20$--$0.32$,并且对前沿法官没有任何操作(Spearman $ρ{=}{-}0.84$ 在能力和增益之间超过 $14$ 有能力的法官,$p{<}10^{-3}$),将效益集中在进行大规模评估的地方。