论文

像飞行员一样思考:细粒度长视距无人机导航

Think Like a Pilot: Fine-Grained Long-Horizon UAV Navigation

模型评测基准与评测资源

摘要

语言引导的无人机代理必须执行长视距语义指令,同时产生平滑、物理上可行的连续飞行命令,但现有的视觉语言导航(VLN)基准通常使用离散或粗略的动作,而现有的无人机视觉语言动作(VLA)任务侧重于短的原子机动。为了解决无人机任务设置中的这一差距,我们引入了 \textbf{FLIGHT},这是一个用于 \textbf{H}ybrid 无人机导航和推理 \textbf{T} 要求的细粒度 \textbf{L}ong-horizon \textbf{I}nstruction-\textbf{G}uided 基准,它将多阶段指令与跨两个数据集分割的密集 6-DoF 轨迹注释相结合:细粒度 VLN 和长视野流。为了赋予无人机代理对任务执行状态和任务规划进行实时飞行推理的能力,同时适应高频、实时精确控制,我们进一步提出了 \textbf{FLIGHT VLA},一种异步架构,它将用于任务状态推理的低频流式飞行员视觉语言模型(VLM)与用于连续控制的高频扩散动作模型解耦,并由显式 \textbf{Pilot Reasoning} 监督总结当前飞行状态并预测下一个子目标的文本。在闭环评估中,FLIGHT VLA 在我们的 FLIGHT 基准测试中始终超越了代表性的 VLN 和 VLA 基线,实现了更强的多阶段完成、子目标遵守和终端控制。其训练有素的 Streaming Pilot Reasoning VLM 进一步改进了无人机视频推理,验证了我们设计的有效性。