论文
SpaceMind++:面向视频多模态大模型空间定位的客体中心认知地图
SpaceMind++: Toward Allocentric Cognitive Maps for Spatially Grounded Video MLLMs
摘要
最近的多模态 大语言模型 (MLLM) 在视觉理解和基于语言的推理方面取得了显着进展,但它们缺乏在 3D 环境中进行空间一致推理的持久的以世界为中心的表示。受到哺乳动物双流系统的启发,其中语义和空间线索被单独处理并集成到异中心认知图中,我们提出了 SpaceMind++,这是一种视频 MLLM 架构,可以从 RGB 视频显式构建体素化认知图。该地图将碎片化的以自我为中心的观察结果重新组织为共享的 3D 度量表示,使模型能够在不断变化的视点中保留对象的持久性和空间拓扑。为了使这种异中心表示可供预训练的视频 MLLM 使用,而不破坏其本机视觉词元接口,我们引入了坐标引导深度迭代融合,这是一种将地图级空间知识传递回原始 2D 视觉特征的新机制。这种融合是由坐标嵌入和 3D 旋转位置编码明确引导的,它们在度量 3D 空间中奠定了语义交互的基础,类似于感官特征与度量空间的内嗅绑定。大量实验表明 SpaceMind++ 在 VSI-Bench 上实现了最先进的性能。此外,它在 SPBench、SITE-Bench 和 SPAR-Bench 上展示了卓越的分布外泛化能力,强调了其在不可见的 3D 环境中的鲁棒性。