论文
CMMR-VLN:经由持续多模态记忆检索的视觉语言导航
CMMR-VLN: Vision-and-Language Navigation via Continual Multimodal Memory Retrieval
摘要
尽管大语言模型(LLM)已被引入视觉语言导航(VLN)以提升指令理解与泛化,现有基于LLM的VLN缺乏选择性回忆并利用相关先验经验辅助导航任务的能力,限制了其在长时程与陌生场景中的表现。本工作提出CMMR-VLN(基于持续多模态记忆检索的VLN),一个赋予LLM智能体结构化记忆与反思能力的VLN框架。具体而言,CMMR-VLN构建以全景视觉图像与显著地标为索引的多模态经验记忆,以在导航中检索相关经验;引入检索增强生成流水线,模仿有经验的人类导航者利用先验知识的方式;并纳入基于反思的记忆更新策略,选择性地存储完整成功路径以及失败案例中的关键初始错误。全面测试显示,在仿真与真实测试中,CMMR-VLN相对NavGPT、MapGPT与DiscussNav分别取得52.9%、20.9%、20.9%与200%、50%、50%的平均成功率提升,印证了CMMR-VLN作为骨干VLN框架的巨大潜力。
