论文
联合图像特征扩散中的协同演化表示
Coevolving Representations in Joint Image-Feature Diffusion
摘要
联合图像特征生成建模最近已成为一种通过将底层VAE潜变量与从预训练视觉编码器中提取的高级语义特征相结合来改进扩散训练的有效策略。然而,现有的方法依赖于固定的表示空间,该表示空间独立于生成目标而构建,并且在训练期间保持不变。我们认为引导扩散的表征空间本身应该适应生成任务。为此,我们提出了协同演化表示扩散(CoReDi),这是一个框架,其中语义表示空间在训练过程中通过与扩散模型联合学习轻量级线性投影来演化。虽然天真地优化这个投影会导致退化的解决方案,但我们表明,可以通过停止梯度目标、归一化和防止特征崩溃的目标正则化的组合来实现稳定的协同进化。这种表述使语义空间能够逐步专门化满足图像合成的需求,从而提高其与图像潜在特征的互补性。我们将 CoReDi 应用于 VAE 潜在扩散和像素空间扩散,证明自适应语义表示可以改善这两种设置的生成建模。实验表明,与在固定表示空间中运行的联合扩散模型相比,CoReDi 实现了更快的收敛和更高的样本质量。