论文

RATS:通过寄存器注意力实现图像块交互与部件涌现

RATS! Patches Talk Through Registers: Emergent Parts in Register Attention Transformers

模型架构Transformer

摘要

当人类看到一只鸟时,他们认识的不仅仅是“鸟”——他们看到的是头部、翅膀和爪子,这些可重复使用部件的结构化组装可以在他们见过的每只鸟中识别出来。我们询问自我监督的视觉模型是否可以自行发现相同的构图结构。为此,我们提出了 RATS(注册注意力 Transformer),它将分类词元分解为 N 个可学习的注册词元,这些注册词元通过三步压缩通信广播注意力通过 L->N->N->L 瓶颈路由图像块信息。 N 个寄存器被划分在 H 个注意力头中,因此分配给不同头的寄存器不会相互交互。如果没有辅助损失或部分注释,每个语域都会自发地专门研究一个原始语义区域,其新兴结构类似于对象部分。 RATS 在五个细分基准中平均超过所有基线 +12 mIoU,在 ADE20K (+1.11 mIoU) 和 COCO (+0.2 AP^m) 上持续增长。其寄存器字典进一步展示了相关类别之间的部分级一致性和语义接近性。我们的结果表明,RATS 可以为结构化和可解释的视觉表示学习提供有用的架构先验。