论文
SpaceVLN:具有在线空间认知记忆和推理功能的零镜头视觉和语言导航代理
SpaceVLN: A Zero-Shot Vision-and-Language Navigation Agent with Online Spatial Cognitive Memory and Reasoning
摘要
连续环境中的视觉和语言导航要求智能体了解以前未见过的环境的空间结构,以便遵循语言指令。尽管基础模型为无需特定任务的策略训练的零样本导航开辟了一条有希望的道路,但许多导航者仍然依赖局部视觉线索和基于线性历史的推理,忽视了跨探索区域、遍历路径、地标及其空间关系的导航的空间性质。在本文中,我们提出了 SpaceVLN,这是一种围绕空间认知记忆和任务引导空间推理构建的导航代理。具体来说,SpaceVLN 引入了一个高效的分阶段闭环框架,其中规划和执行是围绕可验证的空间——地标阶段进行组织的。在导航过程中,智能体逐步将探索的区域抽象为空间航点,并动态维护基于子任务的地标证据,形成分层空间认知记忆,以实现进度定位和空间关系理解。在此内存的基础上,Spatial-CoT 将任务进度推理与空间感知、分析和预测相结合,从而实现任务引导的空间推理以实现具体导航。统一的阶段接口使 SpaceVLN 能够在统一的零样本设置下解决视觉和语言导航和对象目标导航,而无需特定于任务的策略训练。在 R2R-CE、RxR-CE、GN-Bench 和 HM3D-OVON 中,SpaceVLN 实现了最先进的零样本性能,真实的机器人部署进一步验证了其适用性。这些结果强调了空间认知记忆和任务引导的空间推理是更强的具身导航代理的实践基础。