论文
LLM 默默地纠正非裔美国人英语:通过激活指导审核和减轻方言偏见
LLMs Silently Correct African American English: Auditing and Mitigating Dialect Bias via Activation Steering
摘要
非裔美国英语 (AAE) 是一种受规则管辖的方言,有超过 3000 万人使用,经常被 大语言模型 (LLM) 误解和“纠正”。在六个指令调整的 LLM(14B 到 70B)中,我们表明最先进的模型系统地更喜欢标准美式英语(SAE)延续,即使前面的上下文是 AAE,有效地将 AAE 重写为 SAE。我们提出了一个端到端框架来审核和减轻这种偏见。对于审核,我们引入了条件方言组不变性 (cDGI),它将真正的模型偏差与译者引起的伪影隔离开来,并引入了特征级本地化分析,以识别哪些 AAE 标记最强烈地触发偏差;我们发现句法结构,尤其是否定一致(例如,“不是没有人”),是所有模型中的通用触发器。为了缓解这种情况,据我们所知,我们引入了激活控制在方言偏差方面的第一个应用:无需训练,测试时方法,通过因果追踪提取方言方向并将其注入到偏差相关层中。激活引导比提示减少偏见 5 到 20 倍,同时保持 SAE 流畅性。为了实现这项工作,我们发布了 REAL-AAE,这是迄今为止最大的真实 AAE 并行语料库:来自自然推文的 17,479 个 AAE/SAE/ AAE_back 三元组(比之前的真实 AAE 资源大 2 到 6 倍),由三个 AAE 母语人士自动验证(BERTScore F1 = 0.95)(语义一致性为 83.0%)。