论文

在自监督中寻找以对象为中心的分布式属性 Transformer

Finding Distributed Object-Centric Properties in Self-Supervised Transformers

模型评测模型行为与机制分析

摘要

像 DINO 这样的自监督视觉 Transformer (ViTs) 表现出一种发现物体的新兴能力,通常在最后一层的 [CLS] 标记注意力图中观察到。然而,这些地图通常包含虚假激活,导致对象定位不佳。这是因为 [CLS] 词元是在图像级目标上训练的,它总结了整个图像而不是关注对象。这种聚合淡化了本地补丁级交互中存在的以对象为中心的信息。我们通过使用所有层的补丁级注意力组件(查询、键和值)计算补丁间相似性来分析这一点。我们发现:(1)以对象为中心的属性被编码在从所有三个组件($q,k,v$)派生的相似性图中,这与仅使用关键特征或 [CLS] 词元的先前工作不同。 (2) 这种以对象为中心的信息分布在整个网络中,而不仅仅局限于最后一层。基于这些见解,我们引入了 Object-DINO,这是一种提取这种分布式以对象为中心的信息的 无需训练 方法。 Object-DINO 根据补丁的相似性对所有层的注意力头进行聚类,并自动识别与所有对象相对应的以对象为中心的聚类。我们展示了 Object-DINO 在两个应用中的有效性:增强无监督对象发现(+3.6 至 +12.4 CorLoc 增益)以及通过提供视觉基础减轻多模式 大语言模型 中的对象幻觉。我们的结果表明,使用这种分布式的以对象为中心的信息可以改善下游任务,而无需额外的训练。