论文

CoNav-UAV:通过Stackelberg学习实现双高度协同空中导航

CoNav-UAV: Cooperative Dual-Altitude Aerial Navigation via Stackelberg Learning

智能体系统Agent 协作

摘要

面向目标的视觉-语言导航(VLN)在无人机平台上吸引越来越多的关注,用于灾害救援、基础设施检查和安全巡逻等任务。在这种任务中,无人飞行器(UAV)需要根据简要描述其外观和环境来定位目标。这要求全局探索和定位,以及避免碰撞的近距离接近,这两者在单个智能体中难以协调。现有的方法将地面VLN范式移植到低空无人机,并通过外部帮助补偿其不高效的探索。最近的一个尝试在互补高度的无人机上部署,但仍依赖于特权信息并独立训练其两个智能体,从而无法进行任何合作中的必要适应性调整。在这里,我们提出CoNav-UAV,它明确地将任务视为一个斯塔克勒格赛(Stackelberg game)在高海拔的领导者和低海拔的跟随者之间进行,系统仅依赖于在机载视觉和语言输入上进行操作。为解决这个博弈,我们引入迭代斯塔克勒格学习。领导者高层的视觉-语言推理通过基于记忆的上下文学习进行细化,而跟随者的精确运动控制通过DAgger式专家蒸馏进行更新。交替使两者朝着斯塔克勒格均衡前进。CoNav-UAV在AerialVLN基准中的三个高质量的城市场景中连续优于单个和双智能体基准。学习场景的成功率提高了30.8个点,而跨场景转移时提高了9.0个点,同时使用了大约3倍的适应性数据。进一步的分析验证了领导者和跟随者更新的互补收益,并揭示了跨VLM基础架构的稳健收益,而学习动态则不同。

CoNav-UAV:通过Stackelberg学习实现双高度协同空中导航:论文配图
图 1:CoNav-UAV 概述。 (a) 推理时合作:领导者执行 BEV 锚定并维护目标队列;跟随者通过 FPV 控制导航到调度目标。 (b)迭代Stackelberg学习:领导者更新通过多模态反射和每集的Q值学习来发展记忆库;追随者更新通过每轮 PPO 专家的 DAgger 蒸馏来微调 VLA。