论文
$ω$-0:并发人形机器人操纵的潜在预测世界动作模型
$ω$-0: A Latent Predictive World Action Model for Concurrent Humanoid Loco-Manipulation
摘要
人形家庭任务通常需要并发的局部操作,机器人必须作为单一协调行为移动、调整姿势、保持平衡和操作物体。然而,现有的人形政策通常会分解运动和操纵,而最近的世界行动模型仍然以手臂为中心或以视频为中心。我们提出了$ω$-0,一个潜在的预测全身世界动作模型,用于现实世界的人形并发局部操作。给定语言指令、当前视觉观察和机器人本体感受状态,$ω$-0 直接预测真实机器人执行的控制器兼容的全身动作潜伏。 $ω$-0 不是重建未来视频,而是学习紧凑的未来观察嵌入作为轻量级预测目标,将潜在视觉预见与基于扩散的全身动作生成结合起来。该模型支持自我中心 RGB、外中心 RGB 和外中心深度输入,并利用基于控制器的模拟重放将人类/公共视觉运动先验转化为机器人可执行的潜在动作。我们进一步收集 $ω$-HOME,这是一个 40 多个小时的真实家庭人形数据集,具有同步多视图观察、全身 SMPL 运动、机器人状态和潜在动作。针对 11 项家庭任务的现实实验表明,单个 $ω$-0 模型可以产生平滑的移动操作行为,并且始终优于代表性模仿学习、VLA、人形机器人和 WAM 基线。