论文

通过数据流形几何显式建模生成扩散图像

Diffusion Image Generation with Explicit Modeling of Data Manifold Geometry

应用与实践内容创作

摘要

图像生成模型旨在从底层数据流形中采样数据点,这项任务需要学习和解码密集、低维和紧凑的参数化空间。为了实现这一目标,我们提出了数据流形感知图像扩散模型(MIND),这是一种新颖的框架,通过将离散补丁标记化集成到连续扩散模型的评分函数中来显式地建模流形几何形状。这种方法成功地利用了离散词元的结构量化能力和连续扩散的并行生成灵活性。此外,我们通过一种新颖的 soft top-$k$ 聚合机制实现端到端可微分训练,并引入双分支高频特征嵌入层,以减轻 Transformer 主干在低维输入上的谱偏差。此外,为了进行推理,我们设计了一种多级过渡采样方案,该方案根据时间步长动态调整采样方案。在 ImageNet 256$\times$256 上进行的大量实验证明了 MIND 的有效性。经过 80 轮训练后,我们的基础模型在没有指导的情况下达到了 22.73 的 FID,几乎是普通 DiT-B/2 基线 43.47 FID 的一半。与基线 DiT 和 SiT 相比,所提出的方法平均将 FID 分别减少 15.95 和 9.06。对于在 ImageNet-256$\times$256 上进行引导的图像生成,仅具有 130M 参数的 MIND-B 就实现了 2.06 的 FID,超越了具有 3.1B 参数的 LlamaGen-3B。所提出的具有 715M 参数的 MIND-XL 将 FID 进一步降低至 1.95。我们的 MIND 引入了基于扩散的图像生成的全新视角,为该社区的未来研究和创新铺平了道路。该代码将公开。