论文
扩散中的注意力下沉 Transformer:因果分析
Attention Sinks in Diffusion Transformers: A Causal Analysis
摘要
注意力接收器——接收不成比例注意力的标记——被认为在自回归语言模型中具有重要的功能,但它们在扩散中的作用仍不清楚 Transformer。我们提出了文本到图像扩散的因果分析,动态识别每个时间步的主要注意力接收者,并通过对分数和价值路径的配对 无需训练 干预来抑制它们。在 Stable Diffusion~3 上的 553 个 GenEval 提示中(有 SDXL 证实),删除这些接收器不会降低文本图像对齐 (CLIP-T) 或偏好代理(ImageReward、HPS-v2)的性能,价格为 $k{=}1$;只有在更强的干预下 ($k\!\geq\!10$),HPS-v2 才会表现出依赖于度量的边界,而 CLIP-T 始终保持稳健。尽管如此,抑制引起的感知变化仍然是\emph{sink-specific}——比等预算随机掩蔽大$\sim\!6\times$——揭示了扩散Transformer中轨迹级扰动和\emph{语义对齐}之间的经验分离。 \footnote{代码可在 https://github.com/wfz666/ICML26-attention-sink 获取。}