论文
GlanceWAM:世界动作模型的稀疏测试时间想象力
GlanceWAM: Sparse Test-Time Imagination for World-Action Models
摘要
视频生成模型为机器人学习提供了丰富的物理先验,但现有的世界动作模型(WAM)面临着一个基本的权衡:以控制速率生成同步视频会产生延迟,而放弃测试时的视觉想象力会牺牲任务的成功。我们证明,当视觉想象力在关键路径之外异步生成并直接在潜在空间中消耗时,可以实现实时推理和卓越的成功率。我们引入了 GlanceWAM,它在单个视频 DiT 中将想象与控制解耦:异步提议者在慢速时钟上向前看一眼,想象后台中未来的单个前瞻帧秒,而动作头纯粹在潜在空间中以控制速率(48 毫秒)解码动作块而不会阻塞。 GlanceWAM 通过隔离视频表示的无干扰注意力掩模和适应异步前瞻老化的抗陈旧性水平训练来实现,打破了速度成功的困境。纯粹进行演示训练后,它在 24 任务 RoboCasa 厨房基准测试中达到了 72.2%(超过了同步 Cosmos Policy 的 67.1% 和无想象力协同训练的 64.4%),在 LIBERO 上达到了 99.0%,在 NVIDIA A100 GPU 上每块执行时间为 48 毫秒(比同步基准快 24 倍)。代码可在 https://github.com/linhanwang/GlanceWAM 获取。