论文

探索对比表示学习的扩散去噪动力学

Probing Diffusion Denoising Dynamics for Contrastive Representation Learning

模型训练预训练

摘要

文本到图像的扩散模型表现出前所未有的生成能力,并包含丰富的中间表示,可用于判别性视觉任务。受这一观察的启发,我们研究了一个焦点问题:如何调整预训练扩散模型的去噪动力学以支持判别性表示学习,同时在参数有效更新下保留其生成行为?我们提出 D$^3$CL 作为对这个问题的调查。我们的主要观察结果是,不同扩散时间步长的噪声潜伏可以解释为同一底层图像的随机视图,从而使对比目标能够与标准去噪重建损失相结合。该公式提供了一种简单的方法来探索生成去噪和判别表示学习之间的相互作用,而无需从头开始训练。为了保持自适应轻量级,我们将 LoRA 更新应用于预训练的稳定扩散骨干网,同时冻结原始模型参数。 D$^3$CL 提供了强有力的经验证据,表明重建和噪声水平对比目标可以互补:在 ImageNet-1K 上,它获得了 80.1% 的线性探测精度和 5.56 的 FID,$256 \times 256$ 无条件生成。设计空间上的额外消融表明扩散特征的有用性取决于去噪状态的采样位置和方式。这些结果将 D$^3$CL 确立为预训练扩散模型的参数高效适应框架,表明噪声水平对比学习可以为判别任务构建去噪表示,同时保持生成性能。