论文
NavPatch:使用视觉语言模型进行证据引导的对象级成本图校正
NavPatch: Evidence-Guided Object-Level Costmap Correction with Vision-Language Models
摘要
移动机器人通常依靠几何地图来避障和路径规划,但生成的障碍物表示并不总是与物体影响导航的方式相匹配。低洼电缆可能会被遗漏,柔性窗帘可能会产生虚假堵塞,交通锥可能需要比其观察到的足迹更大的排除区域。我们提出了 NavPatch,一个对象级校正层,它通过视觉语言模型的周期性场景理解来分配 ADD、REMOVE 或 EXTEND 来导航相关对象类别。开放词汇基础可定位对象实例,LiDAR 和 RGB-D 观测提供 3D 支持。观察质量过滤和跨框架维护确定每个校正补丁何时提交、替换或撤销。在跨越五种布局的 50 次真实机器人试验中,NavPatch 的总体成功率为 86.0%。对四种配置总共 200 次运行的消融研究表明,与仅基于当前观察的更新相比,NavPatch 将成功率从 70.0% 提高到 86.0%,并将错误提交率从 68.4% 降低到 40.7%。