论文

RefineFly:用于航空视觉语言导航的故障感知 后训练

RefineFly: Failure-Aware Post-Training for Aerial Vision-Language Navigation

模型训练强化学习

摘要

无人机视觉语言导航(UAV-VLN)要求智能体将视觉观察和语言指令转化为复杂环境中可靠的飞行动作。尽管最近的端到端无人机视觉语言动作(UAV-VLA)策略减少了对单独设计的感知、规划和控制模块的依赖,但其行为克隆目标对闭环执行期间出现的错误提供了有限的监督。强化学习(RL)提供了一种有前途的解决方案,但有限的交互预算、长尾场景分布和策略漂移使持续学习变得复杂。为此,我们提出了RefineFly,这是一种用于端到端 UAV-VLA 策略的故障感知 RL 后训练 框架。 RefineFly 以 词元级 近端策略优化 (PPO) 为基础,在两阶段场景课程中维护动态失败记忆,以在训练从经验采样转向平衡场景采样时维持从未解决的任务中学习。在整个过程中,特定阶段的参考正则化限制了政策偏差。 TravelUAV 基准测试表明,RefineFly 在所有三个分组中均优于所有比较方法,将 AerialVLA 的成功率提高了 3.12 至 8.37 个百分点,总轨迹采样预算约为训练集大小的 30%。此外,消融显示,持续失败学习的好处在不同评估阶段有所不同,而两阶段场景课程提高了整体表现,强调了从失败中学习时训练分布的重要性。