论文
MotionWAM:迈向实时人形机器人操作的基础世界行动模型
MotionWAM: Towards Foundation World Action Models for Real-Time Humanoid Loco-Manipulation
摘要
世界动作模型(WAM)在策略之前结合了视频动态,并在桌面操纵方面显示出令人鼓舞的结果,但对高维视频动作潜在特征的迭代去噪使它们对于实时人形机器人操纵来说太慢。占主导地位的分层范例使问题变得更加复杂,其中高级操纵策略仅控制上半身,而底层控制器则跟踪粗略的基本命令 - 将上半身和下半身放置在不一致的动作空间中,并减少腿部以保持平衡的运动。我们提出了 MotionWAM,这是一种实时 WAM,它通过根据视频世界模型的中间去噪特征调节策略,从单个以自我为中心的摄像机驱动自主人形机器人操作。 MotionWAM 用统一的潜在运动代替上下分割,并预测全身运动标记,这些标记共同涵盖单个动作空间中的运动、躯干运动、高度调节、足部交互和手部操作。三阶段学习框架逐步使视频世界模型适应以自我为中心的视觉动态和目标人形体现。在 9 个现实世界的 Unitree G1 任务中,MotionWAM 实时运行,总体成功率大大优于在相同演示上微调的视觉-语言-动作 (VLA) 基线超过 30%,并执行解耦的上下策略无法达到的任务驱动的足部交互。我们的结果表明,视频预训练的 WAM 可以从桌面操作提升到协调的、类似人类的全身人形控制。