论文
消除语言模型偏差的启发式视角
A Heuristic Perspective on Debiasing Language Models
摘要
语言模型 (LM) 在 预训练 期间经常会产生各种偏见,并可能在交互中表达这些偏见,从而可能造成社会危害。现有方法通常依赖于反事实增强或表示投影。由于计算成本高且难以扩展到更大的模型,这些策略在实践中仍然受到限制。此外,其中许多策略需要手动数据注释,将其范围缩小到特定文化和偏见类别。为了克服这些限制,我们提出了 HEIMAT,一种 HEurIstic 风格的 LM 自动去偏框架。 HEIMAT 包含两个主要步骤:偏置披露和去偏置 微调。第一步,它使用简单的模板构建启发式提示,用于揭示模型偏差并生成相应的上下文提示。在第二步中,它通过最小化这些上下文提示的预测的 Jensen-Shannon 分歧来微调模型,以减少偏差。大量实验表明,HEIMAT 有效减轻了不同文化中的偏见,同时保持了模型的自然语言理解 (NLU) 性能。