论文

代表关注视觉 Transformer

Representative Attention For Vision Transformers

模型架构Transformer

摘要

线性注意力已经成为将 Vision Transformer 扩展到超越密集自注意力的二次成本的一个有前途的方向。一种流行的策略是将空间标记压缩成一组紧凑的中间代理,以调解全球信息交换。然而,现有方法通常从预定义的空间布局中派生这些代理词元,导致词元压缩保持锚定于图像坐标而不是视觉内容的语义组织。为了克服这个限制,我们提出了代表性注意力(RPAttention),这是一种线性全局注意力机制,可以直接在表示空间中执行词元压缩。它不是从固定的空间分区构建中间词元,而是通过遵循轻量级的收集-交互-分发范例,动态地形成一组紧凑的学习代表词元,以使语义相关的区域能够进行通信,而不管其空间距离如何。首先通过基于竞争性相似性的路由将空间词元软聚集成代表性词元。然后,代表们在紧凑的潜在空间中执行全局交互,然后通过查询驱动的交叉注意力将精炼信息广播回所有空间标记。通过用表示驱动的压缩替换坐标驱动的聚合,RPAttention 保留了全局感受野,同时自适应地将词元通信与每个输入的内容结构对齐。RPAttention 将主要词元交互复杂性从空间词元数量的二次缩放降低到线性缩放,同时保持富有表现力的全局上下文建模。跨不同视觉 Transformer 主干的图像分类、对象检测和语义分割的广泛实验证明了我们设计的有效性。