论文
方言税:方言偏差在整个语言建模流程中持续存在
The Dialect Tax: Dialectal Biases Persist throughout the Language Modeling Pipeline
摘要
语言模型 (LM) 中的系统方言性能差距已有详细记录,但现代语言建模流程中这些差异的根源仍不清楚。我们的研究追踪了整个自然语言处理流程中的“方言税”。使用在改变表面形式的同时保持固定含义的平行英语方言语料库,我们首先确认 LM 将匹配的标准美国英语 (SAE) 和方言文本识别为语义上等效的。然而,我们发现了与下游绩效差距相对应的进一步代表性差距。在模型系列和世代中,现代 LM 在标记化、预训练、后训练 和推理过程中对方言文本的编码仍然不均匀。引人注目的是,通过字符级反事实分词器绕过传统的子词分割既不能消除输入和输出的不对称性,也不能消除方言准确性的差距。在 预训练 期间,方言对比完全不相关的 SAE 文档对引起更多不同的梯度更新,这表明模型发现语义等效的方言内容比不相关的 SAE 文档更难学习。在 后训练 期间,奖励模型显示上下文、不稳定的方言偏好,为孤立的 AAVE 专有词元分配比 SAE 专有词元更高的值,而完整的推理上下文会受到任务和模型相关的方言惩罚。总的来说,我们的研究结果表明,方言税不是由任何一个孤立的步骤编码和累积的,而是在语言建模过程的每一步中编码和累积的。