论文
资源较少,分数较高:LLM 评估者中的语言偏见
Lower-Resource, Higher Scores: Language Bias in LLM Evaluators
摘要
LLM 评估者(训练有素的奖励模型并提示 LLM-as-a-Judge)通过成对准确性进行常规验证。在多语言环境中,这是在高成对准确性意味着可靠、语言中立的评分的前提下进行的。我们证明这个假设不成立。我们对 23 种语言中语义相同的指令-响应对进行了实验,发现多语言评估者为不同的评估语言分配了显着不同的分数。这种偏差在统计上是显着的,并且在不同架构和训练范式的八个开放权重评估器中是一致的,在前沿法官中持续存在,并且与语言资源水平密切相关:资源较低的语言得分更慷慨。与此同时,这些偏差对于成对准确性来说是不可见的:评估者的成对准确性达到了 90% 以上,但在全球决策阈值下,不同语言的接受率差异高达 43%,这意味着资源较低的语言中的有害内容更有可能通过安全过滤器。每个语言的阈值需要语言识别,这可以通过代码切换提示来克服。然后,我们研究了为什么资源较低的语言会获得更高而不是更低的分数,并且我们发现模型的不确定性与效果相关:在负对数似然和无标记不确定性度量下,当信心不足时,模型往往会给出更高的分数;然而,在控制不确定性后,语言认同仍然是一个重要的预测因素,并且这种偏差不能仅用内容难度来解释,而是一种结构性的、语言层面的错位。