论文
大语言模型的性别偏见很常见且高度异质
Gender bias across LLMs is common and highly heterogeneous
摘要
随着大语言模型 (LLM) 嵌入决策支持工具并产生实际后果,理解大语言模型 (LLM) 中的性别偏见变得越来越重要。先前的研究仅集中于一小部分模型,对于大语言模型中性别偏见的普遍性和异质性程度持开放态度。我们在 2025 年 4 月至 2026 年 6 月之间发布的十个模型中解决了这一差距,涵盖九个供应商,使用两种范式:对刻板短语的性别归因(研究 1)和对女性或男性虐待或酷刑的道德判断,以防止灾难性结果(研究 2)。在研究 1 中,十个模型中有两个将男性刻板印象归因于女性作家,而三个模型则表现出相反的模式。在研究 2 中,几个模型集中在一种对男性不利的不对称性上,这种不对称性与有记录的人类保护女性目标免受伤害的倾向一致,尽管这种不对称性出现的具体条件因模型而异;相比之下,其他三个模型在不同条件下没有表现出变化。这些结果表明,与性别相关的偏见在大语言模型中很常见。然而,它们的方向和幅度是高度异质的,以至于某些模型的行为方式与其他模型截然相反。因此,偏差审核应被视为一个持续的、多供应商的过程,而不是一次性评估。