论文
视觉 Transformer 需要全面关注吗?通过弹性学习核心进行全球通信
Do Vision Transformers Need All-to-All Attention? Global Communication Through Elastic Learned Cores
摘要
Vision Transformer (ViTs) 通过补丁标记之间的全面自注意力学习丰富的视觉语义表示。然而,这种设计隐含地假设直接的成对补丁交互对于有效的表示学习是必要的。在这项工作中,我们挑战了这一假设,并表明支持全局识别和密集预测的表示可以在没有直接补丁间交互的情况下学习。我们提出了 VECA(视觉弹性核心注意力),这是一种由一小组学习核心介导的核心-外围结构化注意力的视觉 Transformer。补丁词元仅通过这些核心交换全局信息,同时完整的密集补丁集被保留并跨层迭代更新。这将注意力复杂度从 $O(N^2)$ 降低到 $O(N)$,与固定核心预算 $C$ 的补丁数量 $N$ 呈线性关系。与之前的潜在词元交叉注意架构不同,VECA 促进了稀疏全局通信,而无需压缩空间表示本身。沿着核心轴的嵌套训练进一步使单个模型能够在推理时弹性地权衡计算和准确性,而无需重新训练。在图像分类和密集预测任务中,VECA 与全注意力主干网相比仍然具有竞争力,并且在大多数基准测试中优于评估的线性复杂性替代方案。此外,在没有明确监督的情况下,这些核心会开发语义组织的结构,支持跨视频帧的对象标签传输。这些结果表明,无需直接的所有补丁交互即可学习有效的视觉表示。