论文

MemVLN:用于视觉和语言导航的情景和程序记忆

MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation

上下文与知识智能体系统上下文工程Agent 规划

摘要

连续环境中的视觉和语言导航(VLN-CE)要求智能体保持长视野视觉历史记录,以保证轨迹一致性,同时以低延迟执行操作。现有的基于视频的 VLN 方法通常很难同时满足这两个需求。为了应对这些挑战,我们提出了 MemVLN,这是一种新颖的 VLN 框架,可实现最先进的性能和实时推理效率(14 FPS)。 MemVLN 利用视觉编码器来处理连续观察结果,并利用 大语言模型 (LLM) 来解释指令并生成操作。我们方法的核心是应用金字塔分辨率的情景记忆管理。这种机制将计算集中在即时感知上,同时保留压缩的长期历史记录。作为对这种设计的补充,我们引入了用于快速操作的程序内存,以及原子中级操作的紧凑词汇表,以绕过自动回归解码延迟。 VLN-CE 上的实验表明,MemVLN-4B 超越了基准 Qwen3-VL-4B 架构,R2R 中的 SR 提高了 5.8%,RxR 中的 SR 提高了 9.7%,同时推理延迟实现了 7$\times$ 的加速。