论文
AgenticNav:零射击视觉和语言导航作为工具调用工具
AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness
摘要
最近,连续环境中的零样本视觉和语言导航 (VLN-CE) 通过大型视觉语言模型 (VLM) 变得可行。现有方法通常依赖于学习的航路点预测器来提出可导航的操作。这限制了模型的动作空间,并且无法有效地利用深度输入。此外,记忆通常是通过积累较长的文本或视觉历史来处理的,这会压倒即时上下文。在本文中,我们重新思考零样本 VLN-CE 作为 VLM 和环境之间的代理接口,并提出 AgenticNav,这是一种轻量级导航工具,它将动作、深度和内存公开为可调用工具。动作工具允许 VLM 直接选择 RGB 观测值中的目标像素,将其转换为可执行的运动,而不是从预测的路点中进行选择。深度通过按需像素深度工具公开,使 VLM 能够仅在重要的地方请求精确的公制距离。对于记忆,AgenticNav 使用代理记忆架构,结合推理文本历史和紧凑的地图图像,并搭配回忆工具,允许 VLM 有选择地重新访问过去的视觉观察结果。在 R2R-CE 上,AgenticNav 在相同的 VLM 比较下实现了最先进 (SOTA) 的零射击性能,达到 76% 的成功率和 66.50% SPL。消融实验验证了我们的工具和内存设计的有效性,而骨干评估表明,随着 VLM 的改进,导航增益更加一致,凸显了该Harness从未来 VLM 进步中受益的潜力。在两个不同的机器人平台上进行的真实世界实验进一步证明了其零样本泛化性和适应性。