论文
Cog3DMap:使用 3D 认知图进行多视图视觉语言推理
Cog3DMap: Multi-View Vision-Language Reasoning with 3D Cognitive Maps
摘要
对多视图图像的精确空间理解仍然是多模态 大语言模型 (MLLM) 的基本挑战,因为它们的视觉表示主要是语义的,缺乏明确的几何基础。虽然现有方法通过视觉几何模型中的几何线索来增强视觉标记,但它们的 MLLM 仍然需要从这些增强的标记中隐式推断场景的底层 3D 结构,从而限制了其空间推理能力。为了解决这个问题,我们引入了 Cog3DMap,这是一个从多视图图像循环构建显式 3D 内存的框架,其中每个标记都基于 3D 空间并拥有语义和几何信息。通过将这些标记输入 MLLM,我们的框架可以在空间结构化 3D 地图上进行直接推理,从而在各种空间推理基准上实现最先进的性能。代码将公开。