论文

从局部全身 VLA 行为到场景规模空中操纵

From Local Whole-Body VLA Behaviors to Scene-Scale Aerial Manipulation

摘要

视觉-语言-动作(VLA)模型可以实现任务条件交互,但由于昂贵的全身演示、延迟引起的动作状态错位以及跨站点行为组合,将其扩展到场景规模的空中操纵仍然具有挑战性。我们提出了一个统一的框架,用于铰接式无人空中操纵器(UAM)的综合政策训练和场景规模执行。场景可重构管道综合了任务条件、运动动力学可行的轨迹和同步多视图观察,用于 VLA 训练,无需物理平台演示。测量进度对齐实现 (MPAR) 将异步返回的操作块与测量的执行进度对齐,并将它们实现为连续的、动态可行的轨迹。关系场景图将语言目标基于对象实例和可行的交互区域,而拓扑引导的传输则连接跨站点的本地行为。在预言机目标和可行切换条件下,本地 VLA 技能在模拟中取得了 39/60 的成功率 (65.0%)。在增加 500 毫秒延迟的情况下,无论是否存在瞬态命令更新停顿,MPAR 都能将接管相位误差中值比标称时间对齐减少 0.212 秒。完整的系统完成了 21/50 的模拟多站点任务 (42.0%),并在物理铰接式 UAM 上进行了进一步验证。