论文

ProWAM:渐进视觉规划的世界动作模型

World Action Modeling with Progressive Visual Planning

摘要

世界动作模型(WAM)通过从初始观测与指令联合预测未来视觉动力学与动作,已成为机器人控制的有前途范式。但现有WAM难以长程预测:生成稠密视频rollout效率极低。一些近期WAM改为预测单个未来帧而不生成完整视频,却忽略了如何朝目标推进。我们提出ProWAM,一个渐进式世界动作模型,联合预测动作与有序的稀疏视觉子目标序列,为整个任务执行中的动作生成提供显式视觉锚定。该设计自然可扩展:子目标预测可从大规模无动作视频学习,让视频骨干分担动作策略的复杂视觉规划。为高效生成动作,ProWAM仅执行一次视频骨干前向以缓存稀疏子目标特征,免去迭代全视频生成,重规划时只需轻量动作去噪。大量评估显示ProWAM具有更优分布外鲁棒性:仿真基准上在LIBERO-Plus(85.8%)与随机化RoboTwin(75.7%)刷新SOTA,相对最强基线增益至多+35.9%;RoboCasa365上成功率48.1%、困难的Composite-Unseen划分18.2%,总排名第4。关键的零样本真机实验中,ProWAM在新场景成功率达70.0%,较最强基线高+15.0(55.0%到70.0%,相对增益+27.3%)。结果证明了进度索引的视觉前瞻对闭环控制的价值。代码/项目页:https://sii-ferenas.github.io/ProWAM-page。