论文

从视觉到预见:视觉语言模型的预测空间推理

From Sight to Foresight: Predictive Spatial Reasoning in Vision-Language Models

应用与实践视觉感知与空间理解

摘要

预测未来的空间状态支持动态环境中的碰撞避免和及时决策。然而,现有的视觉语言模型(VLM)和空间推理基准主要关注观察到的场景,而超出观察区间的预测空间推理尚未得到充分探索。为此,我们引入了 SpatialMind,一种用于空间推理和未来预测的度量尺度 VLM。其度量深度适配器将空间推理锚定到真实世界尺度,而其渐进状态链则建立当前的空间状态和观察到的动态作为未来预测的基础。给定视频前缀,SpatialMind 可以预测观察到的和未看到的未来帧中的距离、运动方向和空间关系。对于训练和评估,我们构建了一个可扩展的数据引擎,该引擎将实体描述基于度量几何,以生成问答对和状态监督。使用这个引擎,我们构建了 SpatialMind-30K 数据集和 SpatialMind-2K 基准,两者都涵盖驾驶和日常第一人称场景。该基准涵盖三个层面的八项任务:当前状态理解、观察动态理解和未来预测。实验表明,SpatialMind 在我们的基准测试中显着优于通用模型和空间专用模型,同时在 VSI-Bench、OSI-Bench 和 VLM4D 上实现了具有竞争力的零样本性能。

从视觉到预见:视觉语言模型的预测空间推理的原论文方法或结果图
图 3:模型架构。给定观察到的 RGB 视频和空间问题,SpatialMind 通过全局和局部校正利用多视图几何来细化度量深度。我们分别对度量几何和相机运动进行编码,在时间上对齐它们的特征,并通过交叉注意力将它们集成到视觉 token 中。然后,VLM 生成一个渐进状态链,该状态链以目标为基础,建立其当前的空间状态,并根据问题级别延伸到观察到的动态和未来预测,然后再生成最终答案。