论文

SUAVE:以掩码扩散统一视频与动作模型

SUAVE: Unified Video-Action Models via Masked Diffusion

模型架构混合架构

摘要

视觉语言动作模型 (VLA) 继承了预训练视觉语言 骨干模型 的强大语义基础,但通常针对预测动作而不是未来观察进行优化。他们可以看到并采取行动,但他们在行动之前不会想象未来。基于视频扩散 骨干模型 构建的世界动作模型 (WAM) 可以想象,但将语言视为连续 潜空间 上的冻结调节。统一模型将这些模式引入一种架构中,但它们要么以自回归方式解码,一次解码一个 token,要么通过辅助动作头保持视频连续。在这项工作中,我们提出了 SUAVE,一种单一词汇统一动作视频模型,其中掩模扩散 Transformer生成以语言为条件的视频和动作,所有三种模态表示为共享序列中的离散 token。选择在推理时屏蔽哪个 token 会将同一网络转变为世界模型、机器人策略或视频动作模型。对于无动作 co-训练,未标记视频的动作位置用掩码 token 填充,并从损失中排除。模拟和现实世界的实验证明了两个发现。首先,单个 SUAVE 模型可预测长视距视频并充当策略,在静态和动态操作任务上与专用世界模型和专门动作策略竞争。在真实的机器人上,我们的模型在 RTX 5090 GPU 上生成子目标图像和在 1,030 毫秒内跨越一秒运动的 动作块,以每秒 2.5 个动作维持闭环控制。其次,对机器人视频的预训练和对人类视频的 co-训练显着提高了策略的性能和对分布偏移的零样本鲁棒性。总之,这些结果表明,蒙版扩散是统一视频动作建模的实用且通用的基础。

SUAVE:以掩码扩散统一视频与动作模型的原论文方法或结果图
图 2:架构。左:指令由 LLaDA 分词器进行分词,视频上下文由 MAGViT-v2 分词器进行编码。目标和动作 token 开始完全屏蔽,并且从 LLaDA 使用 MMaDA 的图像 token 嵌入加上新的动作词汇初始化的屏蔽扩散变压器将它们降噪到想象的目标框架和 动作块 中。中:32 层中的每一层都是一个标准的 LLaDA 块,其自注意力使用块因果掩码。右图:掩模中的每个单元格都是一个块。注意力在块内是双向的,并且在块之间是因果关系。干净的前缀计算一次并缓存,并且在每个去噪步骤中仅重新计算屏蔽后缀。