论文
逐点绑定视觉特征
Binding Visual Features Point by Point
摘要
尽管在标准基准测试上取得了成功,但视觉语言模型在涉及多对象场景处理的任务上显示出持续的失败,其中包括许多对人类来说相对容易的任务。最近的研究发现,这些失败可能源于基本无法在上下文中准确绑定对象特征,这一挑战在认知科学和神经科学中被称为“绑定问题”。人类视觉系统被认为通过串行处理来解决这一绑定问题,一次处理一个单独的对象,以避免其他对象的干扰。最近的工作提出了“指向”——使用显式空间坐标来指代对象——作为视觉语言模型的类似解决方案,并发现它可以提高具有挑战性的多对象任务的性能。然而,目前还不清楚 $\textit{why}$ (即,在机械或表征层面上)这种方法可以提高性能,以及这与人类视觉中的串行处理有何直接关系。在这里,我们就这个问题进行探究。我们发现学习通过文本进行指向会引发内部视觉搜索例程,并且我们描述了支持该过程的机制。我们还发现,指向行为可以通过 微调 泛化到新任务,这样做可以消除绑定错误并实现组合泛化。这些结果提供了原理证明,即串行处理可以像解决生物视觉一样解决视觉语言模型的绑定问题。