论文

无需看见的预见:面向世界动作模型的潜在未来

Foresight Without Seeing: Latent Futures for World Action Models

模型推理KV Cache

摘要

世界动作模型(WAM)将未来视觉预测与机器人动作生成耦合,使策略能够建模交互过程中物理世界的演化。现有WAM的差异在于预测动力学暴露给动作通路的方式。显式未来型WAM提供对预测场景演化的直接访问,但迭代视频去噪带来高昂推理成本。相比之下,直接策略型WAM能从当前观测高效预测动作,但缺少在推理时将预测动力学暴露给Action DiT的显式接口。为弥合这一差距,我们提出ForeWAM,一种动力学条件化的直接策略型WAM,在不解码未来视频的情况下为动作生成提供预测上下文。其核心Future-KV对当前视觉潜变量和随机未来slot执行单次Video DiT预填充(prefill),并在整个动作去噪过程中复用所得的逐层键值(KV)状态。我们进一步引入由冻结潜在动作教师监督的动力学寄存器(dynamics registers),促使隐式未来状态捕捉交互诱发的转变,如物体运动、接触变化和任务进度。真值未来观测与教师仅在训练期使用;部署时两者皆不需要,也不执行任何未来视频生成。在没有具身机器人数据预训练的情况下,ForeWAM的标准与加速变体在LIBERO上分别取得96.7%和96.9%的平均成功率。标准变体在LIBERO-Plus上进一步取得61.6%的成功率。这些结果表明,直接策略型WAM可以在不显式生成未来观测的情况下,既保持高效的动作预测,又将预测动力学暴露给动作通路。

无需看见的预见:面向世界动作模型的潜在未来:论文配图
图1:世界动作模型(World Action Model)范式。(a) 级联式 WAM 先生成未来观测,再以其为条件预测动作。(b) 联合式 WAM 在统一的生成过程中同时生成未来观测与动作。(c) 直接策略式 WAM 在推理时跳过未来 rollout,以从当前观测提取的潜在世界表征为条件预测动作。(d) 我们的 ForeWAM 保留直接动作预测,同时通过隐藏的未来槽 K/V 状态和动力学寄存器(dynamics registers)额外暴露与动作相关的预测动力学。带斜纹阴影的 token 表示噪声变量;未来槽是随机的内部状态,而非观测到的未来帧。