论文

MobileVISTA:用姿态扰动示范检验移动操作策略泛化

MobileVISTA: Generative Data Augmentation for Pose Generalization in Mobile Manipulation

模型评测模型能力评测

摘要

移动操作机器人越来越多地在动态、非结构化环境执行灵巧任务,但模仿单一机器人位姿示范的端到端策略很脆弱:部署时厘米级位姿偏差就可能使第一人称观测和末端轨迹超出训练分布、损害性能。MobileVISTA联合增强第一人称视觉与重定向动作以补偿基座位姿变化,把标准位姿示范变成不同扰动位姿的训练数据。既有方法常假设相机在驱动链之外刚性安装,或复杂关节机器人几何大多不在画面内;本方法面向相机既受运动链影响、又需在机器人运动时观察该运动链的平台,例如人形机器人。我们在覆盖人形及双臂具身的仿真任务和真实Galaxea R1 Pro上研究。增强数据训练的策略在测试时先前分布外的位姿下更稳健,无需额外收集示范或训练生成模型。在受测人形机器人上收益最大,因为相机随驱动链运动且机器人占据较多画面。视频和附录:https://mobilevista.github.io。

MobileVISTA:用姿态扰动示范检验移动操作策略泛化:论文原图
图 2:MobileVISTA 框架。给定单姿势演示,MobileVISTA 在采样的基本姿势扰动 $\Delta\mathbf{p}\in SE(3)$ 下联合增强观察和动作。视觉分支移除机器人,重新投影场景,并以其重新定位的配置重新渲染机器人,而动作分支通过 $\Delta\mathbf{p}^{-1}$ 重新定位末端执行器空间中的动作以产生 $(\tilde{a}_{t})_{t=1}^{T}$。然后使用该增强数据集来训练姿势稳健的 策略。