论文

Being-M0.7:人形机器人的潜在世界动作模型

Being-M0.7: A Latent World-Action Model for Humanoid Robots

模型训练模型架构应用与实践混合架构预训练机器人

摘要

人形运动操纵需要通过未来场景演化和全身运动来协调运动和操纵,但学习这些能力受到稀缺的机器人演示的限制。人类视频和运动数据集提供可扩展的监督,但许多数据集仅包含视频或运动,而不包含配对的视频运动数据。此外,人体运动并不直接指定可执行的机器人动作。我们提出了Being-M0.7,这是一种潜在的世界动作模型,通过预训练、机器人训练中和动作后训练,将从混合模态人类数据中学习到的视觉运动先验转移到人形控制。我们从超过 10,000 小时的以人类为中心的原始数据中整理了一个语料库,集成了纯视频流、纯运动​​流和配对视频运动流,以学习互补的视觉动力学和全身运动结构。对未来潜在视觉状态和运动的联合预测鼓励视觉表征对未来的运动学进行编码。机器人中期训练会先于机器人视角和身体动力学调整这种粗粒度。在训练后的动作过程中, 动作专家通过门控交叉注意力将来自冻结的、适应的先验图像和本体感觉的视觉预测表征结合起来,将预测上下文扎根于可执行的全身命令中。 Being-M0.7 在 SIMPLE 的比较基线中实现了最高的总成功率,并且与现实世界 Unitree G1 局部操作任务的最强基线相匹配。