论文

大语言模型 中的跨语言偏差:英语和斯瓦希里语的比较分析

Cross-Lingual Bias in Large Language Models: A Comparative Analysis of English and Swahili

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 越来越多地部署在多语言环境中,但安全调整和偏见评估仍然绝大多数以英语为中心。我们通过向 GPT-5.2 和 Gemini 2.5 Flash 跨越九个人口统计偏见轴提交 4,900 个对称的英语-斯瓦希里语提示对来调查社会偏见是否普遍存在于语言中,产生了 19,600 个针对刻板印象普遍性、情绪、拒绝行为和跨语言语义相似性进行评估的完成结果。我们的研究结果表明,偏见是转变而不是转移:刻板印象率在特定轴上变化了高达 12 个百分点,Gemini 在斯瓦希里语中的中性情绪率翻了一番,GPT-5.2 拒绝了 169 个英语提示,而斯瓦希里语为零,这与行为层面上以英语表面形式为基础的拒绝行为一致。超过 55% 的提示对在两个模型中产生了语义上不同的完成结果。这些强化了这样一种观点,即仅英语的偏见审计无法为多语言部署提供足够的覆盖范围。