论文

识别和减轻学术推荐信中的性别暗示:可解释性案例研究

Identifying and Mitigating Gender Cues in Academic Recommendation Letters: An Interpretability Case Study

模型评测鲁棒性、公平性与可信度评测

摘要

推荐信 (LoR) 可能带有隐含的性别语言模式,可能会无意中影响下游决策,例如在招聘和招生方面。在这项工作中,我们调查了基于 Transformer 的编码器模型以及 大语言模型 (LLM) 在对姓名和代词等显式标识符进行去性别处理后,在提交给美国住院医师计划的学术 LoR 中推断申请人性别的程度。在使用三种模型(DistilBERT、RoBERTa 和 Llama 2)对匿名和去性别 LoR 进行性别分类时,观察到明显的性别泄漏,分类准确率高达 68%。文本解释方法,如 TF-IDF 和 SHAP,表明某些语言模式是性别的有力代理,例如“情感”和“人道主义”通常与女性申请人的 LoR 联系在一起。作为创建真正性别中立 LoR 的实验,这些隐含的性别线索被删除,导致重新训练分类器时准确率下降高达 5.5%,宏观 $F_1$ 得分下降 2.7%。然而,申请人性别预测仍然比随机预测要好。在本案例研究中,我们的研究结果强调:1)LoR 包含难以消除的性别识别线索,并且可能会引发决策偏见;2)虽然我们的技术框架可能是迈向更公平的学术和专业评估的具体步骤,但未来需要开展工作来质疑性别在 LoR 审查中所扮演的角色。总而言之,我们的研究结果激励了对现实世界学术推荐信中评价文本的上游审核,作为模型级公平干预措施的必要补充。