论文

并排比较放大了语言模型中的方言偏差

Side-by-side Comparison Amplifies Dialect Bias in Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

即使没有方言标签,语言模型 (LM) 也可以根据其方言的变化表现出偏差,这种行为称为隐性方言偏差。在这项工作中,我们通过评估 LM 如何将刻板特征(源自种族偏见的社会心理学研究)与标准美式英语 (SAE) 和非裔美国白话英语 (AAVE) 中的意图等效推文联系起来,量化在线话语中的隐性方言偏见。虽然之前的研究表明,LM 在单独评估推文时会将更多负面刻板印象与 AAVE 联系起来,但我们惊讶地发现,当并排比较 SAE / AAVE 推文对时,这种偏见会显着加剧,这种设置更能反映使用模型对候选人进行排名的高影响力决策环境。当明确指定方言标签时,偏见只会变得更糟。考虑到商业开发者为减轻 LM 中的偏见所做的大量努力,这一点是惊人的。令人鼓舞的是,我们表明,反事实公平性微调可以减轻某些刻板特征的隐性方言偏见,从而减少单独评估推文时的平均差异,但是,在并排评估 SAE / AAVE 推文时,这些改进并不能始终保持跨特征。我们的研究结果表明,现有的隐性方言偏见评估设置可能低估了其严重性,特别是在对比环境中。此外,即使在安全调整微调之后,明显的方言偏见仍然很明显,这表明它仍然是一个未解决的问题,并激发了对更强大的评估和缓解框架的需求。