论文
目标定位并不等于知道:VLM 需要对象定位来进行空间推理吗?
Grounding Isn't Knowing: Do VLMs Need Object Localization for Spatial Reasoning?
摘要
视觉语言模型(VLM)可以回答空间问题,但将物体基础与空间推理联系起来的机制仍然知之甚少。目前尚不清楚空间推理内部是否需要精确的对象定位,或者可以通过全局布局线索绕过显式定位。在这项工作中,我们使用一套机械可解释性工具(包括标记消融、分层探测、注意力剔除和因果中介分析)研究了两个代表性模型系列 LLaVA-1.5 和 Qwen2.5-VL。我们发现空间关系预测遵循分阶段的基础推理过程,其中对象对齐的标记建立粗略的目标参考锚点,而不需要精确的边界框边界。在关系决策出现之前,位置信息就变得可解码,并且一小部分注意力头调解定位和空间推理的因果效应。这两项任务共享早期与目标定位相关的处理,但最终依赖于部分不同的专门途径。通过严格的实验,我们提供了 VLM 如何将对象基础转换为空间关系的词元级、层级和头级说明,表明知道对象在哪里并不等于知道它们如何关联。