论文

PointWAM三维点轨迹WAM

PointWAM: 3D World Action Modeling for Dexterous Robotic Manipulation

摘要

世界动作模型联合学习预测世界动力学与机器人动作,使学到的内部世界动力学引导准确动作。现有方法通常以RGB帧或其潜变量表示世界、以末端位姿或关节角预测动作,难以捕捉灵巧操作核心的三维空间结构与接触几何。我们提出PointWAM,一个三维世界动作模型:把世界分解为场景(环境)与手(执行体),在共享时空坐标系中把两者联合预测为3D点轨迹。这一显式解耦表示使在大规模人类演示视频上的预训练无需任何任务特定物体或关键点选择。给定彩色点云与语言指令,PointWAM预测场景与手在三维空间中随时间的共同演化,再把预测的手部运动重定向为机器人动作。人类视频预训练使DexJoCo平均成功率提升56.9个百分点,场景轨迹监督再增10.9点;两者兼备时,PointWAM在十个DexJoCo任务上超过此前SOTA 11.7点,并在真实机器人上优于强VLA。