论文
FairFlow:揭秘并减轻文本到图像扩散中的刻板印象偏差 Transformer
FairFlow: Demystifying and Mitigating Stereotype Bias in Text-to-Image Diffusion Transformers
摘要
多模态扩散 Transformer (MM-DiTs) 已成为现代文本到图像生成系统的普遍支柱。然而,他们表现出严重的一致性漏洞,即使在良性提示下也会系统地表现出严重的刻板印象偏见。这在已部署的系统中带来了算法歧视的重大风险。由于大多数现有缓解策略都是针对旧版 U-Net 架构量身定制的,因此精确修复 MM-DiT 中的这些漏洞仍然是一个关键的开放挑战。在这项工作中,我们首先通过机制分析调查此漏洞的根本原因。我们揭示了 MM-DiT 中的偏差表示在深度上并不是均匀分布的,而是由一组充当内部语义绑定中心的稀疏层来调节。这些中心表现出阶段性传播驱动偏差的表现:早期中心建立容易受到偏差影响的结构模板,中间中心主动从文本调节中提取核心刻板概念,而晚期中心通过视觉自注意力在全局范围内巩固这些偏差。利用这些架构见解,我们提出了 FairFlow,一种内在的、机制引导的缓解框架。 FairFlow 通过采用稀疏引导来充当内部调节器:它学习特定于属性的公平方向,并将它们专门注入到受约束的推理窗口内识别的语义中心。对 FLUX.1-dev 和 Stable Diffusion~3 的评估表明,FairFlow 有效地消除了这些跨性别、种族和交叉设置的刻板印象漏洞,实现了最佳的公平与保真平衡。 FairFlow 具有接近零的推理开销和对复杂提示的鲁棒性,为大规模部署的 MM-DiT 系统提供了轻量级且实用的偏差缓解方法。代码和数据集将在接受后公开发布。