论文
WorldFly:基于世界模型的视觉-语言-动作模型用于UAV导航
WorldFly: A World-Model-Based Vision-Language-Action Model for UAV Navigation
摘要
端到端视觉-语言-动作 (VLA) 模型在无人机导航中显示出了前景。然而,现有的方法通常依赖于历史观察来直接预测行动,通常在密集的城市环境中举步维艰,在这些环境中,严重的遮挡和急转弯会导致剧烈的视点转换。我们认为,“想象”未来状态的能力(世界模型所固有的)对于在这种部分可观察性下做出稳健的决策至关重要。为了解决这个问题,我们构建了一个具有挑战性的城市峡谷穿越基准,专门用于评估以严重遮挡和剧烈视点转换为特征的场景中的空间理解。为此,我们提出了WorldFly,一种新颖的基于世界模型的VLA框架,它采用双分支耦合流匹配机制来共同生成未来的视频预测和导航动作,从而通过空间想象明确地指导代理的策略。对我们基准的广泛评估表明,WorldFly 优于其他基准,特别是在看不见的环境中,验证了将世界模型集成到具体航空代理中的有效性。
