论文

通过训练协议在视觉 Transformer 中引入空间局部性

Inducing Spatial Locality in Vision Transformers through the Training Protocol

模型评测模型行为与机制分析

摘要

我们研究训练协议是否可以在从头开始训练的 Vision Transformer (ViT) 的早期层中诱导空间局部性,而无需大规模预训练。在保持架构和优化过程固定的情况下,我们在 CIFAR-10、CIFAR-100 和 Tiny-ImageNet 上将 Baseline 协议与 Modern 协议(AutoAugment/ColorJitter、CutMix 和 Label Smoothing)进行比较,通过平均注意力距离(MAD)和归一化熵来表征每个注意力头。在所有三个数据集中,现代协议在早期层产生了更多局部和更集中的注意力;在 CIFAR-100 上,最小 MAD 从 0.316(基线)下降到 0.008(现代)。为了确定这种效应的来源,我们通过单独添加或删除每个组件来对 CIFAR-100 进行消融研究。结果表明,CutMix 是我们实验中的决定因素:使用 CutMix 的所有条件均表现出 MAD 0.024,而未使用 CutMix 的所有条件仍保持在 MAD 0.210。自动增强和标签平滑对局部性没有独立的影响。总而言之,这些发现表明,CutMix 引起的从部分图像区域进行分类的压力可以促进 Vision Transformer 中局部注意力的出现。