论文
关于高维潜伏的扩散性
On the Diffusibility of High-Dimensional Latents
摘要
表示自动编码器 (RAE) 使扩散模型能够在预训练的视觉编码器的特征空间中运行。然而,许多现成的编码器并未针对忠实重建进行优化,从而丢弃了细粒度的视觉细节。正如预期的那样,对这些编码器进行微调以进行图像重建可以恢复这些细节。然而,也许与直觉相反,这个过程降低了所得表示的有效维度,并且改变的几何形状对生成产生下游影响。具体来说,我们表明,在这个高维空间中的流量匹配中使用标准速度预测需要模型拟合低维信号流形之外的正交噪声方向,从而使得优化效率低下。这促使我们使用干净的数据参数化($\boldsymbol{x}_{0}$-预测),它将学习重点放在底层信号流形上。通过使用多个强重建编码器的实验,我们表明 $\boldsymbol{x}_{0}$ 预测持续提高了文本到图像的生成性能。