论文

MarvisNav:使记忆在零射击对象导航的路线选择上可见

MarvisNav: Making Memory Visible on Route Choices for Zero-Shot Object Navigation

摘要

在搜索物体时,人们会通过考虑可能的目标位置和已经探索过的地点来选择下一步行动。当前视图可以提示与地点相关的记忆,将目标相关性和先前的探索带入相同的空间上下文中。然而,在许多零样本对象导航(ZSON)方法中,视觉语言模型(VLM)从以自我为中心的图像推断有希望的搜索区域,而探索历史则单独表示,例如作为文本或地图。这种分离要么需要额外的融合步骤,要么留下记忆和路由选择之间的对应关系,以供VLM恢复。相反,我们使探索记忆在视觉路线选择上直接可见。我们提出了 MarvisNav,一个 ZSON 框架,它维护一个拓扑图,并将候选节点及其探索状态投影到以自我为中心的视图上,作为承载记忆的视觉路线选择。这些状态捕获了二进制访问之外的本地探索进度。通过将探索状态直接绑定到每个视觉候选者,MarvisNav 使VLM能够联合评估目标相关性和探索状态,而无需单独的事后融合或重新排序阶段。如果没有策略训练,MarvisNav 在 HM3D 上实现了最先进的性能(81.2% SR 和 42.5% SPL),同时在 MP3D 上保持竞争力。它还优于基于VLM的代表性方法,且VLM调用少得多(例如,WMNav 的 7.5%)。跨场景的真实机器人实验进一步验证了其实际可部署性。除了 MarvisNav 之外,我们的研究表明,记忆表示影响VLM决策和 ZSON 性能,强调记忆的有效使用不仅取决于其可用性,还取决于其表示方式。代码和项目页面将在 \url{https://wangjincheng1998.github.io/MarvisNav/} 中提供。

MarvisNav:使记忆在零射击对象导航的路线选择上可见的原论文方法或结果图
图 3:MarvisNav 概述。 (1) 给定 RGB-D 观测值和智能体位姿,MarvisNav 通过骨架化可导航空间并为每个节点分配局部探索状态来构建状态感知 RVG。 (2) 在每个决策站点,本地 RVG 拓扑确定以自我为中心的视图的数量和方向。可见路径和候选节点被投影到这些视图中,其中每个候选节点都用字母标签和颜色编码的探索状态进行注释。 (3) 给定目标和带注释的视图,VLM联合评估目标相关性和探索状态。它所选择的字母直接决定了下一个导航目标。