论文
无需看见的预见:面向世界动作模型的潜在未来
Foresight Without Seeing: Latent Futures for World Action Models
摘要
世界动作模型(WAM)将未来视觉预测与机器人动作生成耦合,使策略能够建模交互过程中物理世界的演化。现有WAM的差异在于预测动力学暴露给动作通路的方式。显式未来型WAM提供对预测场景演化的直接访问,但迭代视频去噪带来高昂推理成本。相比之下,直接策略型WAM能从当前观测高效预测动作,但缺少在推理时将预测动力学暴露给Action DiT的显式接口。为弥合这一差距,我们提出ForeWAM,一种动力学条件化的直接策略型WAM,在不解码未来视频的情况下为动作生成提供预测上下文。其核心Future-KV对当前视觉潜变量和随机未来slot执行单次Video DiT预填充(prefill),并在整个动作去噪过程中复用所得的逐层键值(KV)状态。我们进一步引入由冻结潜在动作教师监督的动力学寄存器(dynamics registers),促使隐式未来状态捕捉交互诱发的转变,如物体运动、接触变化和任务进度。真值未来观测与教师仅在训练期使用;部署时两者皆不需要,也不执行任何未来视频生成。在没有具身机器人数据预训练的情况下,ForeWAM的标准与加速变体在LIBERO上分别取得96.7%和96.9%的平均成功率。标准变体在LIBERO-Plus上进一步取得61.6%的成功率。这些结果表明,直接策略型WAM可以在不显式生成未来观测的情况下,既保持高效的动作预测,又将预测动力学暴露给动作通路。
