论文

通过专家引导的 GRPO 实现精确的意图一致 VLA 空中导航

Towards Precise Intent-Aligned VLA Aerial Navigation via Expert-Guided GRPO

模型训练强化学习

摘要

视觉-语言-动作 (VLA) 模型为无人机 (UAV) 提供了一种有前途的端到端范例,以完成细粒度指令指定的复杂任务。然而,标准监督的 微调 (SFT) 存在数据稀缺、泛化能力有限以及对细致入微和复杂的人类意图的监督薄弱等问题。强化 微调 提供了一种自然的方式来缓解这些挑战,并通过可设计的反馈使政策行为与人类意图保持一致,但由于在广阔的连续空间中探索效率低下,将其应用于空中导航仍然具有挑战性。为了应对这些挑战,我们引入了一种用于基于 VLA 的空中导航的高效强化学习 (RL) 框架。其核心是,我们提出 EG-GRPO(专家指导组相对策略优化),以通过少量专家数据来增强在线部署。此外,我们设计了一个异构管道,支持并行仿真和推理,从而将执行轨迹时间缩短了 43.5%。在复杂的人类意图指定的多个任务中,EG-GRPO 将成功率提高到 SFT 基线的 2.13 倍,同时将意图对齐性能提高了 60.9%。这些结果表明,我们的框架可以将空中导航转向精确的意图一致飞行。