论文
LLM 作为法官估计中的偏差和不确定性
Bias and Uncertainty in LLM-as-a-Judge Estimation
摘要
LLM-as-a-Judge 评估已成为评估基础模型性能的标准工具。然而,通过朴素估计器(即原始判断输出)来表征表现存在系统性偏差。最近的工作提出了估计器来纠正这种偏差,但它们的可靠性主要取决于判断质量,对于模型比较,还取决于校准稳定性。在比较模型之间共享校准实际上很有吸引力,但可能会引入严重的偏差,包括比较估计以高明显置信度指向错误方向的情况。我们通过分析结果、对判断质量 ($J$) 和跨模型校准不稳定性 ($ΔJ$) 的模拟以及具有符号反转的真实数据 MMLU-Pro 案例研究来研究这些故障模式。我们建议 $J$ 和 $ΔJ$ 作为修正估计(尤其是共享校准比较)可能不可靠时的诊断,并为 LaaJ 评估提供报告指导。