论文
SpatialAnt:通过主动场景重建和视觉预测进行自主零射击机器人导航
SpatialAnt: Autonomous Zero-Shot Robot Navigation via Active Scene Reconstruction and Visual Anticipation
摘要
视觉和语言导航 (VLN) 最近受益于多模式 大语言模型 (MLLM),实现了零次导航。虽然最近基于探索的零样本方法通过利用全局场景先验显示出有希望的结果,但它们依赖于高质量的人工场景重建,这对于现实世界的机器人部署来说是不切实际的。当遇到看不见的环境时,机器人应该通过预探索建立自己的先验。然而,这些自建重建不可避免地不完整且存在噪声,这严重降低了依赖于高质量场景重建的方法的性能。为了解决这些问题,我们提出了 SpatialAnt,这是一个零镜头导航框架,旨在弥合不完美的自我重建和稳健执行之间的差距。 SpatialAnt 引入了一种物理基础策略来恢复基于单目重建的绝对度量尺度。此外,我们提出了一种新颖的视觉预期机制,而不是将嘈杂的自重建场景视为绝对空间参考。这种机制利用噪声点云来呈现未来的观察结果,使代理能够执行反事实推理并修剪与人类指令相矛盾的路径。在模拟和现实环境中进行的大量实验表明,SpatialAnt 的性能显着优于现有的零样本方法。我们在 R2R-CE 基准上实现了 66% 的成功率 (SR),在 RxR-CE 基准上实现了 50.8% 的 SR。 Hello Robot 上的物理部署进一步证实了我们框架的效率和功效,在具有挑战性的现实环境中实现了 52% 的 SR。