论文
通过增强的空间先验推进愿景 Transformer
Advancing Vision Transformer with Enhanced Spatial Priors
摘要
近年来,Vision Transformer (ViT) 在计算机视觉界引起了广泛关注。然而,ViT 的核心组件 Self-Attention 缺乏明确的空间先验,并且存在二次计算复杂性,限制了其适用性。为了解决这些问题,我们提出了 RMT,这是一个强大的视觉主干,具有用于通用目的的明确的空间先验。 RMT利用曼哈顿距离衰减引入空间信息,并采用水平和垂直分解注意力方法对全局信息进行建模。欧几里得增强版 Vision Transformer (EVT) 建立在 RMT 的优势之上,是一个扩展版本,包含多项关键改进。首先,EVT使用更合理的欧氏距离衰减来增强空间信息的建模,与RMT中使用的曼哈顿距离相比,可以更准确地表示空间关系。其次,EVT 放弃了 RMT 中的分解注意力机制,而是采用更简单的空间独立分组方法,为模型在控制每个组内的 token 数量方面提供了更大的灵活性。通过解决这些修改,EVT 提供了一种更复杂、适应性更强的方法,将空间先验纳入自注意力机制中,从而克服了与 RMT 相关的一些限制,并进一步增强了其在各种计算机视觉任务中的适用性。图像分类、对象检测、实例分割和语义分割方面的大量实验表明,EVT 表现出卓越的性能。在没有额外训练数据的情况下,EVT 在 ImageNet-1k 上实现了 86.6% 的 top1-acc。