论文

FSD-VLN:空中长视距视觉语言导航的快慢双系统建模

FSD-VLN: Fast-Slow Dual-System Modeling for Aerial Long-Horizon Vision-Language Navigation

模型架构混合架构

摘要

视觉语言导航(VLN)通过将语言指令映射到实时视觉输入,实现无人机在未知环境中的自主导航。与依赖GPS或预编程的导航相比,VLN支持直观的人机交互和更强的环境适应性,需要高级语义推理和低延迟飞行控制的紧密结合。现有方法存在全局多模态理解和顺序动作生成之间的结构性错位,导致长视距空中导航轨迹抖动和严重的决策延迟。为了解决这个问题,我们提出了 FSD-VLN,一种快慢双系统架构,解开语义推理和低延迟飞行命令生成。该框架有两个异步分支:一个从预训练的视觉语言模型中提取稳定语义先验的慢流,以及一个扩散 Transformer (DiT) 快速流建模跨时间动作分布以产生一致的飞行输出。我们进一步引入了时间感知自适应优化器来稳定长序列训练并减少梯度振荡。大规模低空仿真实验表明,FSD-VLN 在未见过的场景中实现的导航成功率比 SOTA 方法高出 2 倍,同时将单动作推理延迟和总任务运行时间减少 50% 以上。我们的工作验证了解耦语义控制建模的好处,并为长视距空中 VLN 提供了实用范例。