论文

DreamFly:航空视觉语言导航的因果记忆和后退地平线扩散规划

DreamFly: Causal Memory and Receding-Horizon Diffusion Planning for Aerial Vision-Language Navigation

智能体系统Agent 规划

摘要

空中视觉语言导航(VLN)需要一个实体代理随着时间的推移整合视觉证据,规划未来的行动,并确定何时在部分可观测性下达到导航目标。尽管最近的 VLA 模型提供了一种很有前途的感知到行动范式,但由于历史背景有限、规划期限短和不可靠的隐式终止,使其适应空中导航仍然具有挑战性。为了应对这些挑战,我们提出了 DreamFly,这是一种基于 Dream-VLA 的基于扩散的空中 VLN 框架。 DreamFly 引入了一种因果对齐的历史记忆,仅使用当前决策步骤之前的观察来增强当前的视觉表示,从而实现时间推理,而不会泄漏未来的信息。我们进一步将导航制定为后退扩散规划,其中策略预测 $K$ 步操作块,但在重新规划之前仅执行第一个操作。这种计划-$K$、执行一策略使用未来行动作为辅助规划目标,同时保留闭环视觉反馈。最后,LiteStop 直接根据初始全掩码状态下的动作 logits 估计停止概率,从而将显式终止与动作生成解耦。 OpenFly 基准测试表明,在可见和不可见的环境中都取得了一致的改进。 DreamFly 在测试可见/测试未见的分割上分别实现了 32.04%/29.46% SR 和 28.22%/23.54% SPL,在这两个指标上均优于所有比较方法,同时实现了最低的导航误差。这些结果证明了对空中 VLN 的历史背景、未来行动结构和显式终止进行联合建模的有效性。