论文

LDM-is-AE:潜在扩散模型是用于端到端图像生成的自动编码器

LDM-is-AE: Latent Diffusion Model is an Auto-Encoder for End-to-End Image Generation

模型架构新型架构

摘要

潜在扩散模型(LDM)通常采用两级管道:首先预训练自动编码器(AE)以定义潜在空间,然后训练扩散模型以在其中执行去噪。这种两阶段设计引入了表示失配,因为潜在空间针对重建进行了优化,而不是适应去噪动态。我们揭示了 LDM 本身是一个 AE,因此提出了 LDM-is-AE,这是一种端到端的单阶段 LDM 训练框架,无需单独训练分词器。我们的主要观察结果是,LDM 主干实际上在每个去噪步骤中执行潜在到特征到潜在的转换,这可以解释为内部解码-编码过程。利用这种结构,我们将 DiT 主干分为两个相互的组件,DiT-E(即 DiT 编码)和 DiT-D(即 DiT 解码),并对所有时间步长的中间特征施加图像空间监督。我们的模型鼓励内部表示在整个去噪过程中与图像域保持一致,从而建立明确的潜在到图像到潜在的路径。在零噪声时间步长,我们的模型进一步执行图像到潜在图像的映射,对应于自动编码过程。因此,LDM-is-AE 以端到端的方式联合学习潜在表示和去噪动态,产生适合生成过程的扩散原生潜在空间。实验表明,LDM-is-AE 表现出极具竞争力的生成性能,在 256x256 和 512x512 类条件图像生成上分别实现了 1.80 和 1.90 的 FID。