论文

多语言中冲突信息下的语言偏差 LLM

Language Bias under Conflicting Information in Multilingual LLMs

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 (LLM) 已被证明在回答问题时整合冲突信息的过程中包含偏见。在这里,我们要问的是,对于每条相互冲突的信息使用哪种语言,是否也存在这种偏见。为了回答这个问题,我们将大海捞针范式中相互冲突的针扩展到多语言环境,并使用五种不同语言的自然新闻领域数据对一系列不同大小的多语言 LLM 进行一组全面的评估。我们发现所有经过测试的 LLM(包括 GPT-5.2)都忽略了冲突,并且在大多数情况下只自信地断言可能的答案之一。此外,在首选语言的模型和提示语言之间存在一致的偏见,普遍偏向俄语,而对于最长的上下文长度,偏向中文。在中国大陆境内和境外训练的模型之间的语言偏好是一致的,尽管前一类模型的语言偏好稍强一些。模型中还存在一种普遍趋势,即优先考虑与提示语言相匹配的信息。我们希望让多语言 LLM 的用户和开发人员意识到此类偏见,以促进对其原因和可能的缓解措施的进一步研究。