论文

VTM-Nav:利用分层视觉拓扑记忆的对象目标导航的跨情节经验

VTM-Nav: Harnessing Cross-Episode Experience for Object-Goal Navigation with Hierarchical Visual-Topological Memory

上下文与知识记忆Agent记忆

摘要

无需训练 ObjectNav 代理越来越多地使用视觉语言模型 (VLM),但通常会在每次请求后丢弃获取的场景知识。我们研究跨情节 ObjectNav,其中每个请求都是独立初始化的单目标情节,并且只有自我获得的场景范围的记忆在各个情节中持续存在。我们询问具有固定模型参数和导航组件的代理是否可以在无需重新训练或预言信息的情况下重用此类经验。我们引入了 \method,一个具有持久分层视觉拓扑内存(VTM)的 无需训练 框架。 VTM 使用粗略的房间拓扑来索引房间拥有的视觉记忆,区分房间内和远程可见的证据,并保留成功的接近线索。对于每个请求,VTM-Nav 都会在累积的场景结构中重新定位代理,从合理的房间中检索与目标相关的记录,并根据当前观察得出的候选者的记忆指导。保守的执行守卫进一步处理局部故障。在匹配的 40 步比较下,VTM-Nav 在 HM3D v0.1、HM3D v0.2 和 MP3D 上分别超出内存重置 WMNav 控制 4.6、2.0 和 0.8 SR 点,且具有相当或更高的 SPL。在 HM3D 上,它还比文本记忆所利用的 WMNav 高出 3.1 和 5.5 SR 点。这些结果证明了通过分层视觉拓扑记忆可以有效地重用跨情节场景体验。