论文

SparseNav:用于免训练视觉语言导航的指令条件稀疏语义感知

SparseNav: Instruction-conditioned Sparse Semantic Perception for Training-Free Vision-Language Navigation

智能体系统Agent 架构与控制循环

摘要

基于地图的视觉语言导航 (VLN) 依靠持久的空间表示将语言理解与几何规划联系起来。然而,获取超出当前指令需求的语义可能会引入不必要的感知成本和不相关的注释。不断积累不相关的对象不仅会浪费计算量,还会使视觉语言模型(VLM)规划器消耗的视觉空间表示变得混乱。为了解决这个问题,我们提出了 SparseNav,这是一个无需训练的框架,遵循“少即是多”的语义导航原则。 SparseNav 持续维护轻量级几何鸟瞰 (BEV) 地图和稀疏地标内存,使用活动子指令按需获取新语义来决定哪些地标需要进行视觉定位。指令管理器首先跟踪导航进度并识别活动地标查询。当查询的地标可见并且其度量位置可以通知下一个决策时,指令条件感知机制就会调用开放词汇分割。由此产生的地标存储器支持 VLM 在混合前沿和局部定向航路点候选之间进行选择。在没有任何额外训练的情况下,SparseNav 在 R2R-CE 上实现了 42.8% 的成功率,在 RxR-CE 上实现了 40.7% 的成功率,两者都在 Val-Unseen 分裂上。受控消融检查语义感知策略和各个框架组件的贡献。此外,我们成功在 Unitree Go2 四足机器人上部署了 SparseNav,该四足机器人配备了用于几何映射和地标视觉定位的 Intel RealSense D455 RGB-D 摄像头以及用于定位的 Livox MID-360 LiDAR,无需预先构建地图。我们使用指令条件路径点导航验证了其在多个室内环境中的有效性。