论文
形式化绑定问题
Formalizing the Binding Problem
摘要
可以说,世界的表示包含有关特征的信息(例如,某物是蓝色的,某物是圆形),而且还包含有关哪些特征是同一对象的一部分的信息(例如,圆形是蓝色),我们将其称为绑定信息。任何能够理解具有多个对象的场景的系统都必须能够解决绑定问题:它需要知道哪些特征属于一起。然而,尽管研究表明 Vision Transformer (ViTs) 知道哪些补丁属于一起,但目前尚不清楚当前的深度学习模型是否学会展示绑定信息,即特征。我们可能认为没有太多的绑定信息,毕竟将特征错误地分配给错误的对象是基于 ViT 的架构的常见故障,尤其是在对象共享特征的场景中。在这里,我们用信息论方法形式化了绑定问题,并引入了一种探测方法来测量模型表示中的绑定信息。我们对 ViT 进行实验,测量架构不同组件的绑定,例如图像摘要词元 [CLS] 或空间词元。我们使用具有不同绑定挑战的数据集,例如特征共享、遮挡和自然特征,同时比较几个预先训练的 ViT 的性能。总的来说,我们的研究表明结合是强视觉识别和推理的关键因素。