论文

语言模型中性别和性别中立生成的神经元级干预

Neuron-Level Interventions for Gendered and Gender-Neutral Generation in Language Models

模型评测模型行为与机制分析

摘要

即使给出中性提示,语言模型(LM)也可以产生性别语言和刻板印象。大多数先前关于 LM 中性别偏见的工作主要通过二元透镜(女性与男性)来审视性别,对中性形式的关注有限,例如他们/他们的代词或中性措辞的职位名称。性别相关信号如何在 LM 的内部表征中编码仍然是一个悬而未决的问题。在这项工作中,我们研究了 LM 中性别特异性神经元的三个类别:女性、男性和中性。我们提出了一种神经元水平的干预方法来识别与每个性别类别密切相关的神经元。然后,我们通过受控生成测试这些神经元,表明激活或屏蔽性别相关神经元可以将句子引导向目标性别形式,同时保留其原始含义。为了评估我们的性别干预方法的有效性,我们整理了两个数据集,其中标记了所有三个性别类别的受控句子,并通过人工评估验证数据质量。对两个开源 LM 的实验表明,性别特异性神经元在模型层之间的分布并不均匀;相反,它们主要集中在最早的层中,而后面的层的贡献较小。与现有方法相比,我们的方法通过两个评估标准实现了更精确的性别控制,非目标性别类别的泄漏更少,并且输出质量稳定。总的来说,我们的工作研究了性别在 LM 中的编码方式,并为神经元干预评估和性别偏见缓解提供了一种简单而有效的受控性别干预方法。代码和数据集可在:https://github.com/zhiwenyou103/Gender-Neuron-Intervention