论文
视觉 Transformer 需要更好的词元交互
Vision Transformers Need Better Token Interaction
摘要
Vision Transformer (ViTs) 可以学习强大的图像级表示,而在长时间训练期间,它们的块表示对于密集预测变得不太有效。我们重新审视这种密集的退化现象,并认为仅靠高范数伪影并不能完全解释它。相反,我们描述\emph{语义扩散}:一种优化捷径,其中全局语义信息通过补丁标记传播超出局部合理范围。我们的分析表明,密集表示质量不仅仅由局部性来捕获:浅层特征可以与前景区域保持更好的对齐,但表现不佳更深的特征,并且 \texttt{[CLS]} 特征对于密集预测仍然是互补的。这些观察结果表明,目标不应该是消除全局背景,而是使词元交互更具选择性。因此,我们研究稀疏注意力作为最小干预,用 entmax-1.5 取代 softmax 注意力,同时保留全局词元连接性。在 ImageNet-1K 上训练 200 个 epoch 的 DINOv1 ViT-S/16 上,这一变化保留了 ImageNet 线性探测精度并显着提高了语义分割性能:VOC mIoU 从 42.80 增加到 48.78,ADE20K 从 19.85 增加到 21.97,Cityscapes 从 36.79 增加到 37.87。这些结果表明,选择性词元混合是改善密集 ViT 表示的简单而有效的偏差。