论文
比较还是不比较:论评估社会偏见的方法实践
To Compare, or Not to Compare: On Methodological Practices in Evaluating Social Bias
摘要
随着 大语言模型 越来越多地部署在关键应用程序中,稳健评估其社会偏见至关重要。然而,当前的文献普遍存在方法论碎片化的问题,从而得出了相互矛盾的结论。这很大程度上源于忽视基准级评估的结构框架。为了解决这个问题,我们引入了一个统一且可控的框架,该框架标准化了异构基准,以系统地将孤立的人口统计评估与强制选择的比较设置进行对比。至关重要的是,这使我们能够理清思想链推理、中立后备选项以及社会偏见评估中其他结构性产物的混杂影响。我们对多个模型家族的评估揭示了巨大的、系统性的范式差距:虽然孤立的评估限制了偏见的激活,但比较环境却充当了潜在歧视的积极催化剂,这种转变主要是由未明确说明的背景驱动的。令人担忧的是,CoT 推理加剧了比较环境下的社会偏见,即使模型提供了中立的后备选项或声称随机回答,这种系统性偏见仍然作为一种确定性偏见而持续存在。最后,我们证明这种比较偏见是一种普遍现象,与模型大小呈正相关。最终,我们提供了一个重要的方法指南:虽然研究人员必须利用比较设置来稳健地审计隐藏的偏见,但从业者不能安全地依赖于模糊的现实世界任务中的比较部署。