论文
DiverseDiT++:量化、分析和促进扩散中的表示多样性 Transformer
DiverseDiT++: Quantifying, Analyzing, and Promoting Representation Diversity in Diffusion Transformers
摘要
Diffusion Transformer (DiTs) 的最新进展得益于其卓越的可扩展性,在视觉合成方面取得了显着进展。为了促进 DiT 捕获有意义的内部表示的能力,REPA 等最近的工作结合了外部预训练编码器来进行表示对齐。然而,社区中对 DiT 内表征学习的基本机制仍然知之甚少。为此,本文首先通过量化分块表示的多样性,对 DiT 的表示动态进行系统分析。具体来说,我们引入了一种新颖的指标,称为加权多样性得分(WDS),来衡量不同区块之间的代表性差异。通过对各种设置下内部表示的演变和影响的广泛调查,我们发现跨块的表示多样性是 DiT 中有效表示学习的关键因素。更重要的是,WDS 在不同的设置、模型规模和训练阶段表现出与合成质量的强相关性(Pearson 的 $r=-0.869$ 与 $\log(\text{FID})$),这表明它有潜力作为反映模型性能的指标和模型优化的原则指南。基于这一关键发现,我们提出了 DiverseDiT++,这是一个明确促进多样化表示学习的新颖框架。具体来说,我们的方法结合了长残差连接来使块之间的输入表示多样化,并结合表示多样性损失来鼓励块学习不同的特征。在 ImageNet $256\times256$ 和 $512\times512$ 上进行的广泛实验表明,当应用于不同大小的不同骨干网时,我们的 DiverseDiT++ 可以产生一致的性能增益和收敛加速,...