论文

HiFi-UMI:仅从高保真 UMI 数据中学习可部署的操作策略

HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone

模型评测基准与评测资源

摘要

高保真且可扩展的数据稀缺是学习可部署操纵策略的瓶颈。真实的机器人远程操作是准确的,但规模化成本高昂;无机器人 UMI 捕获很容易扩展,当前实践主要将结果数据用于 预训练,在 后训练 处添加一个小型真实机器人“锚”。我们询问提高无机器人 UMI 数据的保真度(而不是缩小真实机器人的比例)是否可以消除该锚点。我们推出了 HiFi-UMI,这是一种便携式 UMI 数据生成系统,专为轨迹精度、夹具间相对位姿、同步和视场而设计:头戴式离线立体惯性 SLAM、原生而非重建相对位姿、共享微秒 GPIO 触发器以及每只手两个覆盖约 200 度的广角摄像头。它无需外部跟踪基础设施即可达到 3 毫米工作空间本地末端执行器精度。使用这个语料库,我们演示了零机器人 后训练:仅在 HiFi-UMI 演示上进行后训练的策略直接部署在真实的机器人上,并匹配跨越视觉-语言-动作和世界-动作模型系列的三个骨干网的域内远程操作,在 StarVLA-QwenPI、OpenPI-pi_0.5 和 OpenPI-pi_0.5 上的成功率差异为 -2.5、+3.1 和 -0.6 个百分点LingBot-VA;尽管在评估场景中收集了远程操作基线并且没有 HiFi-UMI 轨迹,但最强策略在精确插入任务上达到了 85%。来自同一语料库的 预训练 在 4,000 小时内将十个未见过的任务的动作错误降低了 41%,并且在 StarVLA-QwenPI 上将真实机器人的成功率进一步提高了 18.1 个百分点。我们开源了 HiFi-UMI-2K,这是 2,000 小时的微秒同步、超宽视场演示,每个演示都通过模拟回放自动重建和验证,作为机器人学习社区的大规模、高保真资源。