论文
几个通道描绘出全貌:揭示扩散中的大规模激活 Transformer
Few Channels Draw The Whole Picture: Revealing Massive Activations in Diffusion Transformers
摘要
Diffusion Transformer (DiTs) 和相关的基于流的架构现在是最强大的文本到图像生成器之一,但提示形状图像语义的内部机制仍然知之甚少。在这项工作中,我们研究了大规模激活:隐藏状态通道的一小部分,其响应始终比其他通道大得多。我们表明,尽管这些渠道稀疏,但它们在三种互补的意义上有效地描绘了整个图景。首先,它们在功能上至关重要:将大量通道归零的受控干扰探针会导致生成质量急剧下降,而干扰一组同等大小的低统计通道会产生边际效应。其次,它们是空间组织的:将图像流标记限制为大量通道并对它们进行聚类产生与主要主题和显着区域紧密对齐的连贯分区,暴露隐藏在明显异常值的子空间内的结构化空间代码。第三,它们是可转移的:将大量激活从一个提示条件轨迹传输到另一个轨迹,将最终图像转向源提示,同时保留目标的大量内容,产生局部语义插值而不是非结构化像素混合。我们在两个用例中利用此属性:文本条件和图像条件语义传输,其中大量激活传输可以实现快速插值和主题驱动生成,而无需任何额外的训练。总之,这些结果将大规模激活重新塑造为一个稀疏的提示条件载体子空间,它组织和控制现代 DiT 模型中的语义信息,而不是激活异常。