论文
MixDiffusion:混合基于扩散的统一条件文本到图像生成模型,用于多条件图像合成
MixDiffusion: Mixing Diffusion-based Uni-condition Text-to-Image Generation Models for Multi-condition Image Synthesis
摘要
文本到图像 (T2I) 生成的最新进展通过结合文本之外的条件实现了可控图像合成。然而,大多数现有的基于扩散的方法仅限于单一类型的控制条件(例如边界框或关键点),这限制了它们的灵活性。为了解决这个限制,我们提出了 MixDiffusion,一个用于多条件 T2I 生成的 无需训练 扩散框架。 MixDiffusion 理论上通过协作集成多个预训练的单一条件扩散模型来支持任意数量的控制条件,包括边界框、关键点、草图、深度图、参考图像和文本。该方法的关键思想是利用导出的积分公式,从多个基于扩散的单条件模型的预测噪声分布中导出基于扩散的多条件图像生成模型的每个去噪步骤中的预测噪声分布,该公式得到严格的理论证明的支持。由于其 无需训练 性质,MixDiffusion 易于部署并易于扩展到新的控制模式。