论文

CGFM-Nav:用于语义引导终身多模态实体导航的认知图场记忆

CGFM-Nav: Cognitive Graph-Field Memory for Semantic-Guided Lifelong Multimodal Embodied Navigation

上下文与知识记忆Agent记忆

摘要

视觉和语言导航(VLN)要求智能体对累积的观察进行推理,同时不断探索看不见的区域。然而,现有的环境表示通常很难共同支持显式语义记忆和持续探索指导。为了应对这一挑战,我们提出了认知图场记忆(CGFM),这是一种持久的多模态场景表示,它将显式关系记忆与连续空间直觉结合起来。 CGFM 将对象、空间关系和视觉观察组织成多模态场景图,从而实现跨导航任务的目标检索和长视野推理。当没有识别出可靠的目标匹配时,基于图的证据将被投影到目标条件的语义前沿领域,以指导对语义上有希望的前沿和区域的探索。在 CGFM 的基础上,我们引入了 CGFM-Nav,这是一种基于基础模型的终身多模态导航框架,它将与任务相关的子图选择、VLM 推理和验证反馈集成到闭合决策环中。 GOAT-Bench上的初步实验表明,在相同的Qwen3-VL-8B骨干下,CGFM-Nav将整体成功率从53.2%提高到63.0%,SPL从30.0%提高到39.6%,证明了外显语义记忆与语义引导探索相结合的有效性。