论文
通过共享鸟瞰图进行空地协作视觉和语言导航
Air-Ground Collaborative Vision-and-Language Navigation via Shared Bird's-Eye Maps
摘要
空地协作视觉和语言导航 (VLN) 将具有全球鸟瞰图的无人机 (UAV) 和具有本地第一人称视角的无人驾驶地面车辆 (UGV) 配对,但该设置在很大程度上仍未得到探索:现有的 无需训练 方法解决了单智能体任务,但不提供协作机制,最近的 CARLA-Air 评估发现五个最先进的 VLA 模型之间没有稳定的协作行为;幼稚的语义通信或双向耦合甚至会降低性能。我们建立了 AGC-VLN(空地协作 VLN),这是空地协作 VLN 的第一个 无需训练 基线。关键的见解是,无需训练 方法将导航分解为基于 VLM 的语义推理和确定性几何执行,公开协作界面:无人机的全局视图,在该界面上将 UGV 报告的姿态和 VLM 锚定目标渲染为带有距离标签的 CAR/GOAL 标记,从而生成共享的鸟瞰图。从这张地图中,UGV获得第一人称视角无法提供的全局空间背景,用冻结的VLM规划一条道路跟随路径,并在闭环控制下执行;与此同时,无人机运行 3D-SPF,这是 SPF 的空间搜索升级版,可以在向下的视野中定位目标并向其飞去。在 CARLA-Air 的 Town10HD 场景中的 100 个闭环场景中,AGC-VLN 达到了 77.0% 的联合成功率,比较弱的个体智能体(无人机,50.0%)的协作增益增加了 +27.0%,并且比最强的已发布的单智能体基线(旅行无人机,53.0%)高出 24.0 个点,这源于无人机的全局视图和全局视图的互补性。 UGV 的道路跟踪执行。项目页面:https://github.com/ZSN2024/AGC-VLN。