论文

对于扩散友好的潜在流形来说什么重要?用于潜在扩散的预先对齐的自动编码器

What Matters for Diffusion-Friendly Latent Manifold? Prior-Aligned Autoencoders for Latent Diffusion

模型训练预训练

摘要

分词器是潜在扩散模型的重要组成部分,因为它们定义了扩散模型运行的潜在空间。然而,现有的分词器主要旨在提高重建保真度或继承预训练的表示,从而不清楚哪种潜在空间对于生成建模真正友好。在本文中,我们从潜在流形组织的角度研究这个问题。通过构建受控分词器变体,我们确定了扩散友好的潜在流形的三个关键属性:相干空间结构、局部流形连续性和全局流形语义。我们发现这些属性比重建保真度更符合下游生成质量。受这一发现的启发,我们提出了先验对齐自动编码器(PAE),它显式地塑造潜在流形,而不是让扩散友好的流形从重建或继承中间接出现。具体来说,PAE 利用源自​​ VFM 和基于扰动的正则化的精炼先验,将空间结构、局部连续性和全局语义转化为明确的训练目标。在 ImageNet 256x256 上,PAE 比现有分词器提高了训练效率和生成质量,达到了与 RAE 相当的性能,在相同的训练设置下收敛速度提高了 13 倍,并实现了新的最先进的 gFID 1.03。这些结果强调了组织潜在扩散模型的潜在流形的重要性。