论文
招聘中应用的开放式大语言模型中性别和种族偏见的语言触发因素
Linguistic Triggers of Gender and Racial Bias in Open-Weight LLMs Applied to Recruitment
摘要
开放式大型语言模型正在迅速进入招聘渠道,但它们的歧视性失败模式——以及这些模型在欧盟人工智能法案高风险分类(附件三)和美国 EEOC 不利影响分析下造成的监管风险——仍然知之甚少。我们提出了对开放权重大语言模型的首次系统性多模型审计,将职位发布语言视为主要实验变量,通过四个受控实验评估了六种模型(Llama 3.2、Mistral、Gemma 3、Qwen 3、Phi 3、DeepSeek-R1),这些实验共同探讨了招聘人员模拟和求职者模拟任务。我们发现(1)代理发布语言会降低招聘人员对女性候选人的推荐分数(r_rb = 0.309,p_Bonf = 7x10^-5;模型固定效应 r_rb = 0.448),而公共语言部分扭转了这种惩罚; (2) 编码排斥语言以大效应抑制非白人招聘人员得分(r_rb = 0.646-0.758),并且在求职者方面,有选择地阻止非白人角色表达兴趣——大规模实施寒蝉效应机制。标签消除实验将明确的人口统计角色标签隔离为主要因果驱动因素,词嵌入关联测试在表征层面证实了这些发现(根据 Caliskan 等人的多词性别属性列表,d = 1.01-1.45)。我们将这些结果转化为具体的部署前审计协议——词汇发布评分、角色条件大语言模型探索以及针对五分之四阈值的不利影响标记——使附件三对招聘中的高风险人工智能施加的文件和风险管理义务得以实施。