论文

致力于定位和修复 Transformer 注意力头中的偏差

Toward Localizing and Repairing Bias in Transformer Attention Heads

模型训练模型编辑与遗忘

摘要

Transformer 语言模型越来越多地用作软件组件,但有偏差的输出仍然难以在模型内部进行本地化和修复。现有的公平性测试和修复方法主要在输入输出或再训练层面上运行,而最近的研究表明,与偏见相关的行为可以集中在一小部分注意力集中。本文研究是否可以通过有针对性的推理时间干预来定位和修复注意力头。我们引入了 ROBIN,一种白盒头级公平性调试方法,它使用对公平性探针的敏感性对注意力头进行排名,并从选定的头输出中删除一个小的偏差子空间。在一项四模型试点研究中,ROBIN 减少了所有模型中测得的 WinoBias 差距,同时比全头归零更好地保持了语言建模质量。这些初步结果表明,磁头级偏差修复不仅应考虑选择哪些磁头,还应考虑如何修改选定的磁头。