论文
“英语(美国)”如何成为默认设置?三角测量 LLM 管道中对美式英语的结构偏见
How Does "English (US)" Become the Default? Triangulating Structural Bias Towards American English Across the LLM Pipeline
摘要
大语言模型 (LLM) 越来越多地嵌入教育、专业和公共基础设施中,但广泛使用的平台将“英语(美国)”暴露为主要英语设置,尽管英语在全球范围内具有多样性。我们问:“英语(美国)”如何成为默认值?我们将这个问题作为结构性偏见来研究,研究数据管理、数字主导地位和语言标准化的地缘政治历史如何与 LLM 开发流程相交叉。使用英式英语作为受控参考,我们构建了 1,813 个匹配的美式英语 (AmE)-英式英语 (BrE) 变体的精选资源,并引入了 DiAlign,这是一种动态 无需训练 方法,用于根据分布证据估计区域对齐。我们对跨数据暴露 --> 表示 --> 生成的 AmE 偏好进行三角测量,联合检查预训练和 后训练 数据、分词器行为和出处、模型预测成本以及跨开发国家/地区的生成语言、提示条件、域和来源、语言类别和语域。 AmE 在所有 6 个经过审计的预训练语料库和 21 个 后训练 数据集中始终受到青睐,通常由标记器更紧凑地表示,并且预测成本较低。在中性英语提示下,它仍然是主流的一代默认值;英式英语提示将这种偏好转向 BrE,但并没有始终消除 AmE 的默认设置。据我们所知,这是对 LLM 开发主要阶段的结构偏差进行的第一个严格的全流程研究。我们的研究结果表明,当代 LLM 将 AmE 视为事实上的规范,引发了人们对全球人工智能部署中语言同质化、认知不公正和不平等的担忧,同时为有针对性的组件级干预提供了严格的基础。