论文

InsightMap:用于具体多模态推理的结构化空间建模

InsightMap: Structured Spatial Modeling for Embodied Multimodal Reasoning

摘要

语言引导的导航需要将部分观察结果与持久的空间参考连接起来,并学习动作如何改变该表示。我们引入了 InsightMap,一个使用自上而下的地图作为显式空间记忆和动作条件预测目标的框架。历史视图链接到标记的地图位置,共享的多模态骨干网共同学习导航动作预测和动作后地图生成。地图预测提供辅助训练监督,而导航推理则根据观察到的空间上下文解码动作。对齐的 RGB-D 数据管道支持用于导航、视觉问答、情境推理和 3D 基础的通用接口。在 R2R-CE 和 RxR-CE 的未见验证拆分中,InsightMap 的成功率 (SR) 分别为 56.9% 和 54.9%。添加地图预测监督将 R2R-CE SR 提高了 4.3 个百分点,按路径长度 (SPL) 加权的成功率提高了 3.2 个百分点。在静态空间任务上,InsightMap 在 ScanQA 上实现了 103.7 CIDEr,在 SQA3D 上实现了 60.1% 的精确匹配精度,在 ScanRefer 上检测到目标提案时实现了 0.5 IoU 的 53.1% grounding精度。在 Unitree Go2 上,它在走廊、实验室和办公室环境中的性能优于 NaVid 和 NaVILA。