论文

从基列河流到大型语言模型的推理分布:隐性方言偏差和大规模语言分析

From a River in Gilead to the Inference Distributions of Large Language Models: Covert Dialect Bias and Linguistic Profiling at Scale

模型评测鲁棒性、公平性与可信度评测

摘要

大型语言模型 (LLM) 越来越多地部署在住房筛选等高风险领域。虽然对齐技术可以减轻生成文本中明显的种族偏见,但它们通常不会影响内部概率分布中的隐蔽态度关联。采用匹配的社会语言学范式,我们研究了四种与住房相关的社会判断中的隐性方言偏见:标准美式英语(SAE)、非裔美国白话英语(AAVE)、尼日利亚标准英语(NSE)和尼日利亚洋泾浜语(NP)。 AAVE 反映了先前隐蔽偏见评估中研究的种族化方言,而 NSE 和 NP 代表了该文献中缺少的非洲黑人、后殖民变体。使用 260 个意义匹配的句子四元组和对住房相关形容词的对数概率评分,我们在三个社会邻近度不同的背景下调查了 10 个开放权重的大语言模型:租户筛选、邻居接受度和室友选择。在所有十个模型中,AAVE 和 NP 始终与比 SAE 更多的负面形容词相关,其中 NP 受到的惩罚最严重。至关重要的是,每种方言都受到不同的刻板印象集群而不是通用的非标准类别的惩罚。具有机构威望的 NSE 表现出一种与环境相关的转变:在正式租户筛选中比 SAE 更受青睐,但随着社会距离的增加而受到越来越多的惩罚。我们的研究结果表明,大语言模型在种族身份和声望维度上继承了隐秘的方言偏见,这与记录在案的人类住房歧视相呼应,并证明了其对后殖民英语变体的影响。