论文

当消除偏见适得其反时:基于预处理的刻板印象缓解的违反直觉的副作用

When Debiasing Backfires: Counterintuitive Side Effects of Preprocessing-Based Stereotype Mitigation

模型评测模型行为与机制分析

摘要

基于预处理的刻板印象缓解方法(例如去偏语料库上的 pre-/后训练)在 NLP 中广泛使用。虽然这些方法减少了对目标群体的可衡量的刻板印象,但我们发现它们经常会引起意想不到的转变副作用,其中刻板印象或反刻板印象可能相对于其他人口统计数据的中性基线增加,包括不相关的人口统计类别。我们在两个模型系列(仅编码器和仅解码器)、多种预处理策略(删除刻板句子、删除组提及和交换组引用)以及维基百科上不同数据规模的 pre- 和 后训练 上演示了这些副作用。标准基准经常会错过这些转变。使用注意力展开分析,我们观察到这种副作用并不伴随注意力流的巨大变化,从而使机制解释变得复杂。我们讨论评估的影响,提供可行的诊断,并主张副作用感知、透明的缓解实践。