论文

量化和减轻 LLM 法官的自我偏好偏差

Quantifying and Mitigating Self-Preference Bias of LLM Judges

模型评测评测方法与指标

摘要

LLM-as-a-Judge已成为自动化评估系统的主导方法,在模型对齐、排行榜构建、质量控制等方面发挥着关键作用。然而,这种方法的可扩展性和可信度可能会因自我偏好偏差(SPB)而严重扭曲,这是一种方向性评估偏差,其中 LLM 在评估过程中系统地偏向或不偏向自己生成的输出。现有的测量依赖于昂贵的人工注释,并将生成能力与评估立场混为一谈,因此对于现实世界系统中的大规模部署来说是不切实际的。为了解决这个问题,我们引入了一个完全自动化的框架来量化和减轻 SPB,该框架构建了质量差异可以忽略不计的同等质量的响应对,从而能够在没有人工参考标准的情况下从统计上区分偏见倾向。对 20 个主流 LLM 的实证分析表明,高级能力通常与低 SPB 不相关,甚至负相关。为了减轻这种偏差,我们提出了一种基于认知负荷分解的结构化多维评估策略,该策略平均将 SPB 降低了 31.5%。