论文
Motubrain:机器人控制的先进世界动作模型
Motubrain: An Advanced World Action Model for Robot Control
摘要
视觉-语言-动作(VLA)模型在语义上概括得很好,但通常缺乏对世界动态的细粒度建模。我们提出了 Motubrain,这是一个统一的世界动作模型,它采用三流 Mixture-of-Transformer 架构,在 UniDiffuser 公式下对视频和动作进行联合建模。单个模型支持策略学习、世界建模、视频生成、逆动力学和联合视频动作预测,同时扩展到异构多模态数据,例如纯视频、任务无关和跨实体机器人数据。 Motubrain 在 Motus 的基础上进一步引入了统一的多视图建模、用于更强的语言动作耦合的独立文本流、共享的跨实施例动作表示以及用于长期现实世界控制的高效 后训练 和部署方案。我们的推理堆栈结合了步数缩减、编译、FP8 量化、DiT 缓存、V2A 式纯动作推理和实时分块闭环执行,在简单基线上实现了超过 50 倍的加速,推理速度高达 11 Hz。实验上,Motubrain 在干净和随机设置下在 RoboTwin 2.0 上分别实现了 95.8% 和 96.1% 的平均成功率,在我们的 WorldArena 比较中获得了最强的报告 EWMScore,并适应了仅 50--100 条轨迹的新人形实施例。这些结果表明,统一的世界行动模型可以在通用性、预测准确性和现实世界的可部署性方面进行扩展。