论文
ImagineUAV:通过世界动作建模和运动动力学规划进行空中视觉语言导航
ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning
摘要
无人机的视觉语言导航 (VLN) 要求在部分可观测性下将自由格式指令植入 6 自由度飞行中。虽然视觉-语言-动作(VLA)模型擅长语义推理,但由于几何不一致和动态不匹配,它们存在脆弱性。为了解决这个问题,我们提出了 ImagineUAV,这是一种利用级联世界动作建模的想象力驱动框架。 ImagineUAV 没有采用直接回归,而是采用潜在视频扩散模型来生成以指令为条件的未来观察结果,明确地想象环境演化,并通过动作提取器从中推断出 6-DoF 运动。然后,运动动力学规划器将这些估计细化为无碰撞轨迹。此外,逐步提炼的推理管道可确保实时执行。 ImagineUAV 仅具有 1.3B 参数,在基准测试和实际飞行中优于先前的 VLN 和 VLA 基线,验证了想象驱动航空导航的实用性。