论文
LLM作为法官的设计选择有多重要?提示设计、评定量表和模型的系统比较
How Much Do LLM-as-a-Judge Design Choices Matter? A Systematic Comparison of Prompt Designs, Rating Scales, and Models
摘要
研究人员越来越多地使用大语言模型作为法官(LLM-as-a-judge)来评估模型输出。然而如何设计这些法官却没有标准。通常,研究人员直观地选择提示、评分量表和模型。如果这些选择改变了法官的判决,两项研究可能会对相同的事实得出不同的结论。为了解决这一风险并为法官设计提供经验基础,我们针对两项任务评估了多个设计中的 10 个推理模型:句子情感和毒性的标量评级(每个类别超过 500 个项目),以及问答对的二元准确性分类(n=600)。对于评分任务,尽管评委们对人类的基本事实表现出明显的分歧,但实际差异的大小足以认为大多数评委是可靠的(在 1 - 7 等级上平均绝对偏差为 0.11 分);毒性判断甚至优于标准分类器。法官对于准确率分类任务的平均准确率也很高(96.5%)。然而,设计选择可能会产生变化:仅改变评分量表就可以将测量偏差最多改变 0.93 个百分点(评分任务),虽然准确性水平很少受到影响,但设计选择始终会影响法官的宽大程度(分类任务;使用详细提示时宽大程度下降 28.9 个百分点,而切换模型时宽大程度下降最多 56.1 个百分点)。与直觉相反,较低的推理努力既不会影响准确性,也不会影响宽大程度。在这两项任务中,模型同一性是方差的主要来源。这些发现表明,虽然LLM法官总体上是值得信赖的,但设计选择可能是有意义的差异来源。鉴于LLM研究中对自动评估的依赖日益增加,我们打算将这项研究作为设计更强大和可复制的LLM作为法官管道的方法参考。
