论文
VOMMI:便携演示数据支持移动操作
VOMMI: Collecting and Leveraging Portable Demonstrations for Mobile Manipulation
摘要
便携式移动操纵演示可以帮助缓解实体智能的数据稀缺性,但从 RGB 观测中获得可靠、低成本且无需机器人的运动监督仍然具有挑战性。现有的方法通常依赖于远程操作或配备额外传感硬件的专用设备,而直接使用估计的视觉里程计(VO)轨迹可能会由于累积的漂移和不完善的运动监督而导致不一致。我们提出了视觉里程计条件移动操纵接口 (VOMMI),这是一个便携式演示集合和学习框架,通过离线轨迹重建和在线视觉运动调节将便携式 RGB 演示连接到视觉语言动作 (VLA) 后训练。 VOMMI 同步身体和手部视图以捕获导航上下文和本地对象交互,无需人机运动学对应校准。 R2-VO 使用稀疏几何锚点细化离线演示轨迹,并在多个预测范围内生成因果局部运动 token,以进行在线策略调节。操作组剩余适配器仅将这些 token 合并到基础分支中。实验对每项任务使用 500 条便携式轨迹,其中 75 条轨迹 保留测试 用于 RGB-VO 评估,并以 200 个机器人演示作为参考。我们的策略仅在便携式演示中进行后训练,与使用机器人收集的演示进行训练的策略相比,其基本速度误差降低了 18.2%,同时保持了相当的末端执行器平移精度。相对于每个流的最佳评估基线,离线重建将身体和手流的绝对轨迹误差平均减少了 24.6%。整个系统在三个真实机器人任务中的平均成功率比 OpenPI 0.5 提高了 8.3 个百分点。
