论文
学习全景感知 VLA,用于全身远程操作的移动操作
Learning Panorama-Aware VLA for Mobile Manipulation with Whole-Body Teleoperation
摘要
移动操纵是体现智能的关键能力,使机器人能够在开放世界环境中完成复杂的多阶段任务。然而,移动操控对视觉-语言-动作(VLA)政策提出了两个关键挑战:在数据层面,高质量全身演示的有效收集需要移动底座和机械臂的协调控制;在模型层面,现有的VLA模型主要依赖于局部相机观测,其有限的视野阻碍了全局空间理解。为了应对这些挑战,我们开发了全身远程操作系统和全景感知 VLA 策略。该系统可以通过单个 VR 界面对轮式双手动机器人进行协调控制,并支持获取包含 5.5 小时多模态演示的真实移动操作数据集。在此数据集的基础上,我们提出了 PanoVLA,一种用于移动双手操作的全景感知视觉语言动作策略。 PanoVLA 基于 Transformer 混合架构构建,通过专用全景编码和融合模块引入全局空间上下文,从而能够将全景观测与语言指令和机器人状态有效集成以生成动作。对四个现实世界移动操作任务的评估表明,PanoVLA 的平均阶段完成率为 91.3%,端到端成功率为 73.4%,大大优于本地视图基线。这些结果表明,整合全景空间上下文可以提高移动机器人的空间理解和闭环操纵性能。