论文
用于统一世界建模、语言推理和动作合成的世界语言动作模型
World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis
摘要
我们提出世界语言动作(WLA)模型作为一类新的具体化基础模型。 WLA 将文本指令、图像和机器人状态作为输入,共同预测文本子任务、子目标图像和机器人动作,结合 \emph{世界建模接口} 从广泛的自我中心视频中学习,如世界动作模型 (WAM) 和 \emph{语言推理} 能力,以解决复杂的长期任务,如视觉-语言-动作 (VLA) 模型。 WLA 的核心在于 \emph{自回归 (AR)} Transformer 主干网,而不是 WAM 中的双向扩散 Transformer,用于预测 \emph{下一个状态},包括 \emph{语义级别} 文本意图和互补的 \emph{细粒度} 物理动力学。物理动力学由基于专用世界专家的世界建模目标进行监督,并用于简化动作专家的状态-动作相关性的表征。 WLA 利用元查询使世界预测 \emph{隐式} 影响动作生成,以便可以在推理过程中禁用前者。还可以激活世界预测以启用测试时间缩放以改进机器人控制。我们的 WLA-0 原型具有 2B 个主动参数,在 NVIDIA RTX 5090 上每次推理时间达到 40 毫秒。模拟和现实环境中的评估表明,WLA-0 实现了最先进的多任务和长视野学习能力,例如,在 RoboTwin2.0 Clean 上的成功率为 92.94%,在 RMBench 上的成功率为 56.5%。 WLA-0 还有望直接从 \emph{跨实施例机器人视频} 学习新任务,而无需动作注释。