论文

将 LLM 性别偏见锚定到人类基线:跨语言审计

Anchoring LLM Gender Bias to Human Baselines: A Cross-Lingual Audit

模型评测鲁棒性、公平性与可信度评测

摘要

我们审核了英语、韩语、中文和日语中的六个 大语言模型 (LLM) 性别刻板印象。其中三个主要针对英语语言使用(Claude、GPT、Gemini)而开发,另外三个针对东亚语言使用(DeepSeek、Syn-Pro、HyperCLOVA X)。我们采用 HEXACO-100 人格清单,并将每个模型与涵盖 48 个国家/地区的跨文化人类数据集进行锚定,目的不是询问 LLM 是否有偏见,而是询问其性别归因与其所在人群的偏差有多大。我们的研究结果表明,他们的刻板印象的范围大约是人类跨国家范围的 2.5 倍,而且这种效应可以在不同语言之间复合。一种以英语为中心的模型,在韩语提示下,达到了当地基线的 5 倍,即使提示表明候选人已经被雇用,这通常会削弱人类的刻板印象。为了描述这些行为而不对其进行排名,我们引入了跨 24 个(模型 x 语言)单元的四种模式框架——一致性、抑制、重组和放大。项目层面的分析表明,翻译不仅会重新调整刻板印象,还会改变与其相关的属性,将重大的重新排列隐藏在表面之下,同时看起来经过了良好的校准。我们的结果最终表明,没有任何单一的去偏见管道能够跨语言边界均匀地解决偏见。