论文

一致性减少了表达但未编码的性别偏见:统一的框架和研究

Alignment Reduces Expressed but Not Encoded Gender Bias: A Unified Framework and Study

模型评测鲁棒性、公平性与可信度评测

摘要

在训练过程中,大语言模型 (LLM) 学习可能导致下游应用程序中性别偏见的社会规律。大多数缓解措施的重点是减少生成的输出中的偏差,通常在结构化基准上进行评估,这引发了两个问题:输出级别评估不会揭示对齐是否会修改模型的基础表示,并且结构化基准可能无法反映实际的使用场景。我们提出了一个统一的框架,使用相同的中性提示联合分析 LLM 中的内在和外在性别偏见,从而能够直接比较内部表示中编码的性别相关信息和生成输出中表达的偏见。与之前报告的相关性较弱或不一致的工作相反,我们发现在统一方案下测量时,潜在性别信息和表达的偏见之间存在一致的关联。我们进一步检查通过监督 微调 对齐的效果,旨在减少性别偏见。我们的结果表明,虽然后者确实减少了表达的偏见,但可测量的性别相关关联仍然存在于内部表征中,并且可以在对抗性提示下重新激活。最后,我们考虑两个现实的设置,并表明在结构化基准上观察到的去偏差效应不一定适用于例如故事生成的情况。