论文

后训练模型的招聘判断更趋同,可能增加群体排斥

Monocultural Biases: Correlated biases in large language models lead to unequal systemic exclusion rates in hiring

模型评测鲁棒性、公平性与可信度评测

摘要

雇主越来越多地使用大型语言模型 (LLM) 来自动化招聘流程。本文研究了单一文化偏见的风险,其中大型语言模型的广泛部署使整个劳动力市场的偏见同质化,导致某些人口群体遭受更大的系统性排斥。对于十名大语言模型,我们衡量了他们的基础版本和后训练版本的招聘偏见,以确定哪个阶段(预训练或后训练)导致单一文化偏见。我们发现,与基础模型相比,训练后模型回调年长申请人的可能性降低了 3.6%。这种负面转变发生在我们评估的十个模型中的八个中。经过训练的模型比基础模型有更多的相关决策,这可能是由技能或大学专业等人力资本特征驱动的。然而,模型之间更大的共识将全球系统排除率从 5.6% 提高到 17.3%,并加剧了人口不平等,训练后模型的交叉系统排除率在 12.2% 到 21.7% 之间。我们发现这种不平等主要是由年龄歧视造成的,这种歧视在后训练加剧。这些结果表明,虽然后训练技术可能会提高模型选择最佳申请人的能力,但它们可能会通过统一引入新的偏见来增加边缘人群的系统性不平等风险。