论文

具有联合状态-动作生成的人形世界动作模型

Humanoid World Action Model With Joint State--Action Generation

模型训练应用与实践预训练机器人

摘要

人形机器人是一个有前途的通用操纵平台。最近的视觉-语言-行动(VLA)政策直接从多模式观察中学习行动,而世界行动模型(WAM)进一步结合未来的视觉预测以改善行动的生成。然而,在分层人形系统中,VLA 和 WAM 策略输出参考动作,随后通过全身控制、机器人动力学、平衡和接触来实现。这种层次结构造成了行动与执行之间的差距:策略产生的参考可能与机器人实现的运动不同。如果没有明确地建模所实现的身体状态,未来的视觉预测必须共同解释场景演变以及参考动作和执行运动之间的差异,从而很难将动作与其物理结果关联起来。我们提出了 HWAM,一种具有联合状态动作生成功能的人形世界动作模型,它使机器人执行后的本体感受状态成为明确的预测目标。通过共同生成参考动作及其实现的身体状态, HWAM 直接将对执行动作的监督纳入动作学习中。 HWAM 通过三个互补的条件路径进行训练。策略路径联合对状态-行动轨迹进行去噪,仅以当前观察为条件,匹配部署条件。正向动力学建模(FDM)根据动作和执行后状态预测未来的视觉观察,而逆向动力学建模(IDM)则根据视觉转换重建关节轨迹。这些路径共同连接政策参考、实现的身体运动和视觉结果。在 LimX OLI 人形机器人上的三个真实机器人任务的评估基线中,HWAM 取得了最高的成功率。在糖果采摘方面,HWAM 的成功率为 70.6%,而 Fast-WAM 的成功率为 43.3%。