论文
我们可以信任大语言模型法官吗:能力依赖偏差和多法官集成偏差校准的研究
Can We Trust LLM Judges: A Study of Capability-Dependent Biases and Multi-Judge Ensemble for Bias Calibration
摘要
大语言模型越来越多地被用作模型训练和评估的自动法官,但个别法官表现出系统性偏见,损害了可靠性。之前的大部分工作都研究了成对大语言模型法官环境中的偏见;在本文中,我们关注绝对评分任务,它反映了更现实的用例。在四个基准和六个模型(36对法官-考生)中,我们表明模型的任务准确性强烈预测其判断准确性(大多数模型上的 Pearson $r \geq 0.90$)并反向预测其方向偏差($r \leq -0.83$),但仅靠准确性并不能确保公平评估:能力更强的考生模型始终会从所有法官那里获得更宽松的判断($r \geq 0.83 美元)。为了解决这个问题,我们提出了校准加权多数投票(WMV),这是一种集合评估方法,聚合多个大语言模型法官,并根据其假阳性和假阴性率的在线估计进行加权。我们引入了一种基于分歧的估计器,该估计器纯粹从法官间的一致模式得出这些错误率,不需要真实标签或任务元数据。在转移任务分布的模拟实验中,我们的无标签 WMV 跟踪了一个具有完美错误率知识的预言机,平均错误率在 0.5 个百分点以内,优于个人法官和未加权多数投票。这些结果表明,有原则的多判断校准可以同时提高准确性并纠正系统宽容,而无需标记数据,随着模型功能的增加,提供可靠的自动化评估的可扩展路径。