论文

无需训练 通过 CLIP 引导的去噪优化对扩散模型进行去偏

Training-Free Debiasing of Diffusion Models via CLIP-Guided Denoising Optimization

模型推理解码与生成控制

摘要

文本到图像的扩散模型实现了令人印象深刻的视觉质量,但人口统计学偏见仍然是一个挑战,因为中性提示始终会产生跨性别和种族的刻板印象。现有方法仍然受到昂贵的再训练或推理时间干预的限制,这些干预通常会降低图像质量和语义对齐。我们提出文本嵌入引导(TES),这是一个 无需训练 框架,它通过在扩散过程中直接优化条件文本嵌入来减轻人口统计偏差。我们展示了一种两阶段策略——早期全局对齐,然后使用基于 CLIP 的反馈进行迭代去噪时间细化——可以在不修改模型参数的情况下实现稳定且可控的属性控制。关于稳定扩散的大量实验表明,TES 在公平性方面优于现有的 无需训练 基线,同时保持有竞争力的图像质量。这些结果强调,推理时文本嵌入优化是扩散模型中公平感知生成的实用且可扩展的解决方案。