论文
她还相关吗?当 BERT 忽略明确的性别提示时
Is She Even Relevant? When BERT Ignores Explicit Gender Cues
摘要
大语言模型 中的性别偏见主要针对英语进行了调查,而具有语法或形态性别的语言的研究相对较少。本文研究了从头开始训练的荷兰 BERT 模型中性别信息如何以及何时出现,为结合明显形态性别标记和通用形式的语言的 Transformer 架构中的偏见形成提供了第一个检查点级分析之一。通过在整个训练过程中提取上下文嵌入,我们使用线性 SVM 构建动态性别子空间,以跟踪性别何时变成线性编码以及这种编码如何随时间演变。上下文嵌入通常被认为能够稳健地集成上下文线索,从而允许模型根据单词的本地用法来调整单词的表示。因此,我们测试受控句子模板中的明确性别线索(例如,Zij is een loodgieter(“她是管道工”))是否可以覆盖学习到的统计关联(管道工 -> 男性)。我们的研究结果挑战了这一假设:尽管性别在第 20 纪元左右变得明显线性可分,并且分布在多个嵌入维度上,但该模型仍难以根据短句模板中的明确上下文线索来更新其内部性别表示。对刻板印象的性别-职业配对的预测比反刻板印象的配对要准确得多,而且荷兰语中的通用形式系统地默认为男性解释,即使上下文明确表示女性所指对象也是如此。总之,我们的结果似乎表明,我们的荷兰 BERT 模型学习到的表征中的情境化在探索的性别方向上并没有足够的动态性:反刻板印象中的明确性别线索没有可靠地反映在结果表征中,导致持续的男性默认行为。