论文

Exp2VLA:通过专家演示实现无人机导航的视觉-语言-动作

Exp2VLA: Enabling Vision-Language-Action for Drone Navigation from Expert Demonstrations

模型训练合成数据

摘要

视觉-语言-动作(VLA)模型通过在单个端到端框架中直接链接感知、语言和动作,开辟了一条通往直观机器人控制的新途径。然而对于无人机来说,实际采用仍然很困难,因为现有的解决方案要么计算量大,要么在复杂环境中能力不足。在这项工作中,我们提出了一个用于语言条件无人机导航的实用专家 蒸馏 管道(Exp2VLA)。核心思想是将从强化学习、远程操作或其他控制器获得的专家行为提炼成可用于微调紧凑 VLA 模型的训练数据。这使得现有的控制策略可以转移到统一的语言引导的导航模型中,减少手动系统集成并降低部署新机器人行为的障碍。跨多对象场景的模拟到模拟和循环模拟设置的实验表明,微调的模型可以处理各种语义命令并泛化到看不见的目标组合。所提出的框架展示了专家策略 蒸馏 如何帮助机电系统从专用控制模块转向更灵活和可重用的机器人智能。