论文
评估和减轻德语和多语言语言模型中的反 LGBTQ 偏见
Evaluating and Mitigating Anti-LGBTQ Biases in German and Multilingual Language Models
摘要
虽然语言模型中的性别和种族偏见已得到广泛研究,但反 LGBTQ 偏见仍然没有得到充分研究,特别是在英语之外。现有基准通常无法捕捉文化和语言差异,并且依赖于性别代表性。本文介绍了一个多语言德语-英语基准数据集,用于评估语言模型中的反 LGBTQ 偏见。它将来自社区的来自德语酷儿个体的刻板印象与 WinoQueer 的德语翻译结合起来。这些数据用于评估不同规模和架构的八种语言模型,并通过 微调 对社区和渐进式媒体内容探索缓解措施。结果表明,语言模型再现了反酷儿的刻板印象,并且随着身份和模型的不同而存在差异。翻译数据和基于社区的数据之间的差异凸显了文化适应对于多语言偏见评估的重要性。 微调 平均减少了偏差,但在模型和身份之间并不一致。警告:本文包含反酷儿仇恨语言和刻板印象的示例。