论文

公平性崩溃现象:基于合成数据训练的语言模型中的偏差放大

The Fairness Collapse Phenomenon: Bias Amplification in Language Models Trained on Synthetic Data

模型评测鲁棒性、公平性与可信度评测

摘要

在人工生成的数据上训练的生成模型已被证明会表现出模型崩溃,导致性能显着下降。随着合成内容越来越多地污染语言模型的训练语料库,这引起了人们对在持续预训练中使用开放数据的严重担忧。尽管之前的工作已经证明了语言模型中的模型崩溃,但目前尚不清楚接触合成数据是否会放大或减弱预训练模型中已经存在的社会偏见。由于众所周知,语言模型会复制和放大人口统计刻板印象,因此对自我生成的数据进行递归训练可能会创建一个自我强化的反馈循环,其中有偏见的关联在代际之间逐渐变得更强。我们将这种假设的现象称为公平崩溃。在这项工作中,我们构建了受控训练方案,其中使用 Bios 数据集中的偏差对合成数据重复训练模型。在实验中,我们观察到一个一致且令人担忧的模式:在标准语言建模指标反映实质性退化之前,就出现了公平性退化。这一结果凸显了与 模型训练 语言中的合成数据污染相关的关键风险:在模型崩溃的强烈指标变得明显之前,偏差可能会悄然增加。