论文
从视觉到预见:视觉语言模型的预测空间推理
From Sight to Foresight: Predictive Spatial Reasoning in Vision-Language Models
摘要
预测未来的空间状态支持动态环境中的碰撞避免和及时决策。然而,现有的视觉语言模型(VLM)和空间推理基准主要关注观察到的场景,而超出观察区间的预测空间推理尚未得到充分探索。为此,我们引入了 SpatialMind,一种用于空间推理和未来预测的度量尺度 VLM。其度量深度适配器将空间推理锚定到真实世界尺度,而其渐进状态链则建立当前的空间状态和观察到的动态作为未来预测的基础。给定视频前缀,SpatialMind 可以预测观察到的和未看到的未来帧中的距离、运动方向和空间关系。对于训练和评估,我们构建了一个可扩展的数据引擎,该引擎将实体描述基于度量几何,以生成问答对和状态监督。使用这个引擎,我们构建了 SpatialMind-30K 数据集和 SpatialMind-2K 基准,两者都涵盖驾驶和日常第一人称场景。该基准涵盖三个层面的八项任务:当前状态理解、观察动态理解和未来预测。实验表明,SpatialMind 在我们的基准测试中显着优于通用模型和空间专用模型,同时在 VSI-Bench、OSI-Bench 和 VLM4D 上实现了具有竞争力的零样本性能。
