论文
EquiSteer:交叉注意力转向实现更公平的文本引导图像生成
EquiSteer: Cross-Attention Steering Towards a Fairer Text-Guided Image Generation
摘要
文本到图像的扩散模型为日常创意任务提供了动力,但它们仍然在训练数据中重现了人口统计偏差。在诸如“护士的照片”、“首席执行官的照片”等常见提示下,他们将输出偏向于一种性别,这是由训练数据的统计数据而不是文本中的任何内容驱动的。现有的去偏方法在狭窄的设置中显示出希望,但需要重新训练、批量级控制或特定于提示的调整,限制了它们的可扩展性。我们提出 \emph{EquiSteer},这是一种 无需训练 方法,通过在推理时引导交叉注意(CA)激活来针对每个样本工作。对于每个目标属性,EquiSteer 根据对比提示预先计算转向向量。然后在生成时,提示感知门不会影响特定于属性的提示,而对于中性提示,它会清除 CA 激活中的现有属性信号并注入目标属性。在 SD-1.5、SD-2.1、SDXL 和 SANA 中,EquiSteer 将平均奇偶校验差距减少了高达 $87\%$,对图像质量和文本图像对齐的影响最小。代码可在 \href{https://github.com/Atmyre/EquiSteer}{https://github.com/Atmyre/EquiSteer} 获取。%