论文

大语言模型 基于量规的评估中的自我偏好偏差

Self-Preference Bias in Rubric-Based Evaluation of Large Language Models

模型评测评测方法与指标

摘要

LLM 作为法官已成为评估 LLM 输出的事实上的方法。然而,众所周知,法官表现出自我偏好偏差(SPB):他们倾向于偏爱自己或自己家庭的模型产生的输出。这会扭曲评估,从而阻碍模型开发,特别是在递归自我改进的环境中。我们提出了 SPB 在基于评分标准的评估中的第一项研究,这是一种越来越流行的基准范式,法官根据个人评估标准发布二元裁决,而不是分配整体分数或排名。使用 IFEval 和 LiveCodeBench(具有可编程验证的评分标准的基准),我们表明,即使评估标准完全客观,SPB 仍然存在:在生成器失败的评分标准中,当输出是他们自己的时,法官将其错误标记为满意的可能性要高出 50% 以上。我们还发现,与其他评估范式类似,集合多个法官有助于减轻 SPB,但并不能完全消除它。在具有主观评分标准的医疗聊天基准 HealthBench 上,我们观察到 SPB 使模型得分偏差最多 10 分,这在对前沿模型进行排名时可能具有决定性的优势。我们分析了在这种情况下推动 SPB 的因素,发现负面的标题和主观主题(例如沟通和紧急转介)特别容易受到影响。