论文

我一路走来:检查格式塔连续性在视觉对象绑定中的作用 Transformer

I Walk the Line: Examining the Role of Gestalt Continuity in Object Binding for Vision Transformers

模型评测模型行为与机制分析

摘要

对象绑定是视觉认知中的一个基本过程,在此过程中,底层感知特征被加入到对象表示中。绑定被认为是神经网络的基本挑战,也是具有灵活视觉智能的人工模型道路上的一个重要里程碑。最近,多项研究表明有证据表明,预训练视觉模型中出现了绑定机制,使它们能够关联包含对象的图像部分。问题仍然是:这些模型如何将对象绑定在一起?在这项工作中,我们研究视觉模型是否依赖格式塔连续性原则来执行对象绑定,而不是超越相似性和邻近性等其他原则。使用合成数据集,我们证明结合探针对各种预训练视觉 Transformer 的连续性敏感。接下来,我们发现跟踪连续性的特定注意力头,并表明这些头可以跨数据集进行泛化。最后,我们消除了这些注意力头,并表明它们通常有助于生成编码对象绑定的表示。