论文
为什么要远视:探索视觉语言模型中的空间表征
Why Far Looks Up: Probing Spatial Representation in Vision-Language Models
摘要
视觉语言模型 (VLM) 在空间推理基准上取得了出色的性能,但尚不清楚这是否反映了结构化 3D 理解或对自然图像中统计快捷方式的依赖。我们引入了一个表示级分析框架,该框架构建最小对比对来测量空间轴在 VLM 嵌入中的组织和解开方式。我们对多个模型系列的分析揭示了一致的垂直距离纠缠:模型将垂直图像位置与距离混为一谈,反映了自然照片的透视偏差。这种偏差在观点一致和反启发式示例之间产生了显着的准确度差距,并且在数据扩展的情况下加剧,即使总体基准准确度有所提高。我们进一步表明,具有相似基准分数的模型可以表现出不同的内部表示,并且这些差异预测了不同空间推理基准的准确性和鲁棒性。为了将这种偏差与评估集偏差隔离开来,我们引入了 SpatialTunnel,这是一种综合基准,旨在通过消除自然图像中存在的常见相关性来暴露空间捷径偏差。实验证实,纠缠是模型固有的,并且具有良好分离的空间轴的模型表现出更大的鲁棒性,这表明结构良好的空间表示可以在不同的基准上产生更可靠的空间推理。代码和基准可在项目页面上找到:https://cheolhong0916.github.io/whyfarlooksup.github.io/。