论文
通过随机数生成减轻 LLM-as-a-Judge 中的评分偏差
Mitigating Scoring Bias in LLM-as-a-Judge via Random Number Generation
摘要
大语言模型(LLM)通常用作文本质量的评估器,称为LLM-as-a-Judge,它可以优于依赖参考文本的传统自动评估指标。然而,LLM 评估者倾向于生成特定的分数,而不管评估文本的上下文如何,这称为评分偏差。这项研究提出了一种新方法来减轻这种评分偏差。 LLM 被指示随机生成数字标记,并通过测量观察到的数字分布与均匀分布的偏差来识别 LLM 的潜在数字偏差。使用 LLM 评估器的下游任务的定义被添加到随机数生成的提示中,以测量特定于任务的潜在数字偏差。在 LLM 的评估中,考虑到 LLM 的潜在数字偏差,对给定输入的标记生成概率进行纠正。对四个不同任务(LLM 对齐评估、摘要评估、语义文本相似性和语义文本相关性)的实验结果表明,我们提出的方法优于基线,包括没有去偏的 LLM 和以前的校准方法。此外,已证实评分偏差在 LLM、任务和分数范围之间存在差异,这表明根据具体情况测量潜在数字偏差的重要性。