论文

What-Where Transformer:用于并发表示和本地化的以插槽为中心的视觉骨干

What-Where Transformer: A Slot-Centric Visual Backbone for Concurrent Representation and Localization

模型架构Transformer

摘要

许多图像理解任务涉及识别存在的内容及其出现的位置。然而,解决“地点”问题的任务(例如对象发现、检测和分割)通常比图像分类复杂得多,图像分类主要关注“内容”。一个可能的原因是,面向分类的主干网倾向于强调有关“内容”的语义信息,同时隐含地纠缠或抑制有关“位置”的信息。在这项工作中,我们关注称为“何事分离”的归纳偏差,它鼓励模型以分解的方式表示对象外观和空间位置。为了将这种偏见纳入 Vision Transformer (ViT) 风格的专注骨干中,我们提出了 What-Where Transformer (WWT)。我们的方法引入了两个关键的新颖设计:(1)它将标记视为内容的表示,将注意力图视为位置的表示,并通过多流、基于槽的架构在并发前馈模块中处理它们; (2)它重用下游任务的最终层标记和注意力图,并将它们直接暴露于任务损失派生的梯度中,从而促进更有效和更明确的定位学习。我们证明,即使在 ImageNet 上标准的基于单标签分类的监督下,WWT 也可以直接从原始注意力图中展示出紧急的多个对象发现,而不是通过额外的后处理(例如标记聚类)。此外,与基于 ViT 的方法相比,WWT 在零样本对象发现和弱监督语义分割方面实现了卓越的性能,并且可以通过最小的修改转移到各种定位设置。代码将在接受后发布。