论文
PlatonicNav:用柏拉图拓扑图揭示导航中的语义对应关系
PlatonicNav: Unveiling Semantic Correspondence in Navigation with Platonic Topological Maps
摘要
具身视觉导航,即代理感知复杂的环境,并根据原始感官输入采取行动以达到目标,支撑着家庭服务机器人、辅助机器人和大规模自主探索等广泛的应用。然而,最近统一视觉和语言导航(VLN)和目标目标导航(ObjNav)的尝试仍然停留在架构融合、混合任务训练和大型视觉语言预训练的层面,而没有检查独立训练的视觉和语言编码器是否可能已经共享共同的语义结构。此外,即使以对象为中心的拓扑图仍然通过明确的跨模态监督(例如 CLIP 或大型视觉语言模型)来实现语言目标,这对于纯视觉构建的地图是否可能实现这种基础尚无定论。为了应对这些挑战,我们将柏拉图表示假说扩展到具体导航,并将纯视觉 ObjNav、跨模态 ObjNav 和 VLN 重新构建为同一以对象为中心的语义流形的三个不同接口。我们进一步介绍 PlatonicNav,这是一个 无需训练 框架,其柏拉图拓扑图融合了自监督视觉编码器的几何和语义节点距离,并通过盲匹配来确定语言目标,无需任何配对的视觉语言数据。对仿真基准(包括 MP3D 上的 HM3D-IIN、OVON 和 R2R-CE)的广泛实验,以及在 Unitree Go2 上的部署,证明 PlatonicNav 可以在任务、模态和实施例之间进行泛化,而无需显式的跨模态训练。代码:https://github.com/AIGeeksGroup/PlatonicNav。网站:https://aigeeksgroup.github.io/PlatonicNav。