论文
$A^2$:较小的自监督 ViT 比较大的 ViT 本地化效果更好
$A^2$: Smaller Self-Supervised ViTs Localize Better than Larger Ones
摘要
鲁棒的视觉分类通常取决于定位图像中的主要前景对象,同时忽略上下文干扰。令人惊讶的是,我们发现较小的自监督 ViT 的注意力图比较大的 ViT 更好地定位前景对象。然而,我们仍然需要大型 ViT,因为它们从每个补丁中提取更丰富的表示。为了获得两全其美、良好的定位和丰富的表示,我们提出了 $A^2$,这是一种简单的方法,通过将查看位置(小型注意力模型)与提取内容(大型嵌入模型)解耦来利用这种逆缩放发现:我们围绕小模型的注意力峰值进行裁剪,并将裁剪结果嵌入到更大的模型中。 $A^2$ 使用完全预训练的特征,不需要组标签,并且不需要每个数据集的注意力或骨干训练。在 5 个基准测试中,$A^2$ 与 DFR 等骨干匹配损失水平方法相比具有竞争力,并且在更强的分布变化下优于端到端注意力训练。