论文
重新思考扩散中的跨层信息路由 Transformer
Rethinking Cross-Layer Information Routing in Diffusion Transformers
摘要
Diffusion Transformer (DiTs) 已经成为现代视觉生成事实上的支柱,其设计的几乎每个主要轴——标记化、注意力、调节、目标和潜在自动编码器——都被广泛地重新审视。然而,控制信息如何跨层累积的残余流是直接从原始的 Transformer 继承的。在本文中,我们对 DiT 中的跨层信息流沿着深度和去噪时间步进行了系统的实证分析,并确定了传统残差加法的三个具体症状,即单调前向幅度膨胀、急剧后向梯度衰减和明显的块级冗余。受此诊断的启发,我们提出了扩散自适应路由(DAR),这是一种直接的残差替换,可以对子层输出的历史执行可学习的、时间步自适应的和非增量聚合。此外,所提出的 DAR 与许多现代 Transformer 增强方法兼容,例如 REPA。在 ImageNet $256\times256$ 上,DAR 将 SiT-XL/2 提高了 $2.11$ FID($7.56$ vs. $9.67$),并与基线的收敛质量相匹配,训练迭代次数减少了 $8.75\times$。叠加在 REPA 之上,它在早期阶段产生了 2 倍的训练加速,这表明跨层信息路由是扩散建模中尚未充分探索的设计轴,它与现有的表示对齐目标正交运行。除了预训练之外,DAR 还可以应用于大规模 T2I 模型的 微调 阶段,并在分布匹配 蒸馏 期间保留高频细节。