论文
MMaDA-VLA:具有统一多模态指令和生成的大扩散视觉-语言-动作模型
MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation
摘要
视觉-语言-动作(VLA)模型将视觉观察和自然语言指令映射到机器人动作;然而,分层和自回归范式通常会产生架构开销,积累长期误差,并且需要辅助模块来捕获环境动态。为此,我们提出了 MMaDA-VLA,这是一种完全原生的、预训练的离散扩散 VLA,它统一了多模态理解和生成。具体来说,MMaDA-VLA 使用共享的离散词元空间来联合对未来目标观察和动作块进行去噪,从而在没有辅助世界模型的情况下将动作基于预测的视觉结果。通过这种方式,并行、无序的细化提高了长期一致性。大量实验和综合分析表明,MMaDA-VLA 在 LIBERO 上实现了 98.0% 的平均成功率,在 CALVIN 上实现了 4.78 的平均成功序列长度,同时在现实环境中表现强劲。该项目页面位于 https://yliu-cs.github.io/MMaDA-VLA。