论文

DDT-RFE:去除扩散编码残差并融合多层特征

Should We Skip Diffusion?

模型架构新型架构

摘要

扩散模型在生成图像的同时学习语义表示。在解耦扩散Transformer (DDT) 中,条件编码器提供指导速度解码器去噪的功能。为了在所有噪声级别实现有效的去噪,这些功能必须捕获高级抽象结构和低级细节。然而,编码器中的跳过/残留连接允许浅层特征绕过连续的变换,这可能会限制渐进抽象,或者至少使得难以解开不同级别的抽象。我们提出了 DDT-RFE,它消除了每个编码器块中的 Self-Attention 和 MLP 操作周围的残余连接,同时保持稳定的训练。为了保留抽象丢弃但解码器仍然需要的信息,我们将输入补丁嵌入与中间和最终编码器特征融合以形成编码器输出。因此,解码器可以访问来自多个编码器深度的信息,而每个编码器块都能够学习更抽象的表示。 DDT-RFE 在视觉理解任务上实现了相对于 DDT 的整体改进,包括图像分类、语义分割、对象发现和语义对应,同时使用更少的编码器块。它还在 ImageNet 上实现了较低的图像生成 FID。

DDT-RFE:去除扩散编码残差并融合多层特征:论文原图
图 1:左:DDT 和 DDT-RFE(我们的方法)的总体架构。右:时间步长 $t=0.5$ 从浅层到深层的编码器表示。使用 PCA 将特征投影到三维并可视化为 RGB 图像。我们的方法产生更抽象的表示,具有干净的背景和显着的对象。更多可视化如图所示。 5、6 和 7