论文
SUAVE:以掩码扩散统一视频与动作模型
SUAVE: Unified Video-Action Models via Masked Diffusion
摘要
视觉语言动作模型 (VLA) 继承了预训练视觉语言 骨干模型 的强大语义基础,但通常针对预测动作而不是未来观察进行优化。他们可以看到并采取行动,但他们在行动之前不会想象未来。基于视频扩散 骨干模型 构建的世界动作模型 (WAM) 可以想象,但将语言视为连续 潜空间 上的冻结调节。统一模型将这些模式引入一种架构中,但它们要么以自回归方式解码,一次解码一个 token,要么通过辅助动作头保持视频连续。在这项工作中,我们提出了 SUAVE,一种单一词汇统一动作视频模型,其中掩模扩散 Transformer生成以语言为条件的视频和动作,所有三种模态表示为共享序列中的离散 token。选择在推理时屏蔽哪个 token 会将同一网络转变为世界模型、机器人策略或视频动作模型。对于无动作 co-训练,未标记视频的动作位置用掩码 token 填充,并从损失中排除。模拟和现实世界的实验证明了两个发现。首先,单个 SUAVE 模型可预测长视距视频并充当策略,在静态和动态操作任务上与专用世界模型和专门动作策略竞争。在真实的机器人上,我们的模型在 RTX 5090 GPU 上生成子目标图像和在 1,030 毫秒内跨越一秒运动的 动作块,以每秒 2.5 个动作维持闭环控制。其次,对机器人视频的预训练和对人类视频的 co-训练显着提高了策略的性能和对分布偏移的零样本鲁棒性。总之,这些结果表明,蒙版扩散是统一视频动作建模的实用且通用的基础。
