论文
觉醒扩散 Transformer:通过大规模激活调制引发更强的生成和理解
Awakening Diffusion Transformers: Eliciting Stronger Generation and Understanding via Massive Activation Modulation
摘要
大规模激活 (MA) 已在基于 Transformer 的模型中广泛观察到,但它们在扩散 Transformer (DiT) 中的结构和功能作用仍不清楚。在这项工作中,我们系统地分析了代表性 DiT 中的 MA,发现它们在空间上分布在图像标记中,同时集中在一小组固定的特征维度中。我们进一步表明,这些维度与 AdaLN 残差缩放因子密切相关,并且主要由去噪时间步长而不是文本条件进行调制。这种结构导致了两个与任务相关的效果:对于生成来说,MA 对于细粒度细节合成至关重要,同时对全局语义的影响有限;为了便于理解,它们共享的高幅度方向使得原始 DiT 特征在空间标记上过于相似,并削弱了密集特征辨别力。基于这些发现,我们引入了诱导大规模激活(EMA),这是一个 无需训练 框架,它利用大规模激活(MA)作为统一的调制信号来提高 DiT 的生成和表征能力。对于生成,EMA 提出了 MA 驱动的细节指导 (DG),它抑制 MA 维度以构建缺乏细节的反事实预测,并引导采样获得更精细的视觉细节。 DG 进一步支持高效的部分前向推理、与无分类器指导的集成以及用于细化选定图像区域的 词元级 本地 DG。为了便于理解,EMA 引入了 MA 调制 REPresentation 提取 (MREP),它使用预训练的 AdaLN 通道调制来减少 MA 方向优势,并连接空间归一化 MA 映射以保留有用的空间结构。大量实验表明,EMA 不断提高 DiT 的生成质量和表示能力。