论文
评审评审者:LLM-as-a-Judge流程中偏差缓解策略的系统评估
Judging the Judges: A Systematic Evaluation of Bias Mitigation Strategies in LLM-as-a-Judge Pipelines
摘要
大语言模型作为法官已成为评估语言模型输出的主导范式,但大语言模型法官表现出系统性偏见,损害了评估的可靠性。我们提出了一项全面的实证研究,比较了来自四个提供商系列(Google、Anthropic、OpenAI、Meta)的五个判断模型、三个基准(MT-Bench n=400、LLMBar n=200、自定义 n=225)和四种偏差类型的九种去偏差策略。我们的主要发现:(1)风格偏差是主要偏差(所有模型中的偏差为 0.76-0.92),远远超过位置偏差(<= 0.04),但受到的研究关注很少。 (2) 所有模型都显示出对扩展对的简洁性偏好,但截断控制证实它们正确地区分了质量和长度(准确度为 0.92-1.00),这表明质量敏感的评估而不是简单的长度偏差。 (3) 去偏是有益的,但依赖于模型:组合预算策略将 Claude Sonnet 4 显着提高了 +11.2 pp (p < 0.0001),其他模型具有方向性积极趋势。 20 个非基线配置中只有 2 个表现出一致性下降。我们在 https://github.com/sksoumik/llm-as-judge 发布了我们的评估框架、受控数据集和所有实验工件。
