论文

LD4WAM:从人类视频中学习世界行动模型的潜在动态

LD4WAM: Learning Latent Dynamics from Human Videos for World Action Models

模型训练预训练

摘要

人类视频由于其多样性和相对于远程操作机器人数据的较低收集成本,在训练世界行动模型(WAM)中发挥着越来越重要的作用。然而,大多数WAM仅通过预测像素级未来帧来从此类视频中学习,从而给出不可直接操作的动态,而运动重定向恢复直接可操作的动作,但在实施例之间留下很大的视觉差距。因此,我们提出运动对齐的潜在动态作为不依赖具体具身形态的表示,以桥接视频先验和底层动作。我们进一步提出了 LD4WAM,它将经过语义重建和真实运动对齐训练的潜在动力学模型与构建为 Transformer (MoT) 混合的世界动力学动作模型配对,该模型保留了完整的未来视频生成,并使用可学习的查询从生成的未来中提取这些潜在动态以进行动作调节。 LD4WAM 在我们精心策划的超过 5{,}000 小时的人类和机器人数据的统一数据集上进行了预训练,在 RoboTwin 模拟以及配备抓手和灵巧手的真实机器人上表现出色,同时很好地概括了看不见的物体和背景。