论文
RobustDebias:用分布鲁棒优化为语言模型去偏
RobustDebias: Debiasing Language Models using Distributionally Robust Optimization
摘要
预训练语言模型已被证明表现出偏见与社会刻板印象。先前为这些模型去偏的工作大多聚焦在预训练期间修改嵌入空间,这对大模型而言不可扩展。在任务特定数据集上微调预训练模型既会降低模型性能,又会放大微调数据中存在的偏见。我们处理微调期间而非代价高昂的预训练期间的偏见放大,聚焦于因在语言理解任务中广泛使用而选择BERT模型。虽然经验风险最小化(ERM)有效优化下游性能,但它常在微调期间放大社会偏见。为对抗这一点,我们提出RobustDebias,一个把分布鲁棒优化(DRO)改造用于微调期间语言模型去偏的新机制。我们的方法在MLM微调期间跨多个人口群体为模型去偏,并可泛化到任何数据集或任务。在多种语言模型上的大量实验表明,偏见显著缓解且性能影响极小。