MarvisNav:使记忆在零射击对象导航的路线选择上可见
MarvisNav: Making Memory Visible on Route Choices for Zero-Shot Object Navigation
摘要
在搜索物体时,人们会通过考虑可能的目标位置和已经探索过的地点来选择下一步行动。当前视图可以提示与地点相关的记忆,将目标相关性和先前的探索带入相同的空间上下文中。然而,在许多零样本对象导航(ZSON)方法中,视觉语言模型(VLM)从以自我为中心的图像推断有希望的搜索区域,而探索历史则单独表示,例如作为文本或地图。这种分离要么需要额外的融合步骤,要么留下记忆和路由选择之间的对应关系,以供VLM恢复。相反,我们使探索记忆在视觉路线选择上直接可见。我们提出了 MarvisNav,一个 ZSON 框架,它维护一个拓扑图,并将候选节点及其探索状态投影到以自我为中心的视图上,作为承载记忆的视觉路线选择。这些状态捕获了二进制访问之外的本地探索进度。通过将探索状态直接绑定到每个视觉候选者,MarvisNav 使VLM能够联合评估目标相关性和探索状态,而无需单独的事后融合或重新排序阶段。如果没有策略训练,MarvisNav 在 HM3D 上实现了最先进的性能(81.2% SR 和 42.5% SPL),同时在 MP3D 上保持竞争力。它还优于基于VLM的代表性方法,且VLM调用少得多(例如,WMNav 的 7.5%)。跨场景的真实机器人实验进一步验证了其实际可部署性。除了 MarvisNav 之外,我们的研究表明,记忆表示影响VLM决策和 ZSON 性能,强调记忆的有效使用不仅取决于其可用性,还取决于其表示方式。代码和项目页面将在 \url{https://wangjincheng1998.github.io/MarvisNav/} 中提供。
