论文
UMI-Bridge:跨人类和机器人操作数据的动作锚定潜在对齐
UMI-Bridge: Action-Anchored Latent Alignment across Human and Robot Manipulation Data
摘要
真实的机器人演示是有限的,这促使人们使用在没有机器人的情况下收集的人类操作数据,包括以自我为中心的视频和手持式通用操作界面(UMI)演示。然而,视点、实施例和可用动作监督的差异使得很难根据操纵运动而不是视觉外观来对齐这些源之间的表示。我们引入了 UMI-Bridge,它使用 UMI 作为中间域,根据动作等效性而不是像素相似性来对齐表示。 UMI 动作监督将潜在表示锚定于末端执行器运动和夹具行为,而同步头腕观察和配对的自我 UMI 剪辑支持跨视图和域的对齐。我们在没有机器人演示的情况下,在人类操作数据上训练双视图潜在动作模型(LAM),然后冻结其手腕教师和动力学模型,以规范 UMI 和机器人数据的视觉语言动作(VLA)后训练。共享手腕界面可以跨两个域进行训练时监督,同时保留策略的标准推理架构。在三个真实机器人任务中,UMI-Bridge 的平均成功率为 91.7%,而使用匹配的 UMI 和机器人数据进行 Naive Co-training 的平均成功率为 73.3%。在两项数据效率任务中,它超越了仅使用 25% 的机器人演示和 UMI 数据的全数据机器人基线。它还在从 UMI 演示中学到的两项附加任务上取得了 85% 和 90% 的成功,而无需特定任务的机器人演示。这些结果支持基于动作的潜在对齐,以实现数据高效的机器人学习和 UMI 到机器人的任务转移。