论文
DebFilter:消除隐藏在价值中的偏见
DebFilter: Eradicating Biases Stashed in Value
摘要
文本到图像的扩散模型在理论上相当于基于分数的生成模型,通过从预先训练的视觉语言模型(例如 CLIP)中提取的文本嵌入引导的多步骤去噪过程来生成图像。然而,这些文本嵌入本质上编码了社会和语义偏见,例如与性别和年龄相关的偏见,这些偏见随后通过指导机制传播和放大,加上模型在大规模数据集上的训练,这些数据集与这些偏见相关的概念不平衡,通常导致文本到图像生成中的输出出现偏差。我们提出了 DebFilter,这是一个轻量级的 无需训练 框架,用于减轻文本到图像扩散模型中的此类偏差。观察到模型在每个去噪步骤的误差预测主要受到交叉注意力动态的影响,我们引入了一种偏差校正策略来调整交叉注意力内的值分量。具体来说,我们对引导嵌入切片应用固定偏移量,有效地将交叉注意力值的语义方向转向无偏表示。此调整重新配置分数景观以产生平衡的输出,同时保持与预期文本语义的一致性。与之前依赖 微调 或再训练的方法不同,DebFilter 完全在推理时运行,不需要额外的数据或模型更新。我们的结果表明,这种方法有效地减轻了生成图像中的社会偏见,为更公平和更具包容性的文本到图像生成提供了有效且可扩展的途径。