论文
三步导航:零镜头视觉和语言导航的分层全局局部规划器
Three-Step Nav: A Hierarchical Global-Local Planner for Zero-Shot Vision-and-Language Navigation
摘要
通过使用多模态 大语言模型 (MLLM),在未知环境中基于视觉的导航方面取得了突破性进展。这些模型可以通过根据分配给智能体的任务和目标评估每个时间步的当前视图来规划一系列运动。然而,当前由 MLLM 支持的零样本视觉和语言导航 (VLN) 代理仍然容易偏离航线、过早停止,并且总体成功率较低。我们提出三步导航,通过三视图协议来抵消这些失败:首先,“展望”提取全球地标并绘制粗略计划。然后,“现在看”将当前的视觉观察与下一个子目标结合起来,以获得细粒度的指导。最后,“向后看”会审核整个轨迹,以在停止前纠正累积的漂移。我们的规划器不需要梯度更新或特定于任务的 微调,可以以最小的开销投入到现有的 VLN 管道中。三步导航在 R2R-CE 和 RxR-CE 数据集上实现了最先进的零样本性能。我们的代码可在 https://github.com/ZoeyZheng0/3-step-Nav 获取。