论文
WholeBodyWAM:使用可扩展的运动先验学习全身世界动作模型
WholeBodyWAM: Learning Whole-Body World Action Models with Scalable Motion Priors
摘要
人形全身操纵需要协调的全身动力学,但目标机器人的大规模轨迹收集成本昂贵且难以扩展。相比之下,来自人类和类人源的全身运动是大量可用的,尽管此类数据不能直接用作特定于实施例的机器人动作。这项工作询问这些可扩展的运动资源是否可以为人形世界动作建模提供可转移的预测先验。我们介绍 WholeBodyWAM,这是一种人形世界动作模型,可在目标机器人训练之前从大规模异构运动中学习全身动力学。我们策划 UniMotion-4K,这是一个涵盖超过 4K 小时的运动语料库,来自人类视频、原生 3D 运动数据集和异构人形平台,并将这些不同的来源规范化为统一的运动空间。然后,对语言调节的运动专家进行预训练,以在没有目标机器人动作监督的情况下预测未来的全身运动。在机器人后期训练期间,预训练的运动专家通过非对称混合Transformer (MoT) 注意力与视频和动作专家集成,从而实现预测场景动态和全身运动,共同通知具体实施例的动作生成。实验表明,WholeBodyWAM 始终受益于增加的运动预训练规模,改进了未来运动预测和下游任务性能,并有效地转移到现实世界的人形操纵。此外,预训练的运动先验在有限的目标机器人演示下大大提高了数据效率。