论文

Qwen-RobotWorld 技术报告:通过语言条件视频生成统一具体世界建模

Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation

模型架构混合架构

摘要

我们介绍 Qwen-RobotWorld,一种用于体现智能的语言条件视频世界模型。它以自然语言作为统一的动作界面,根据当前对机器人操作、自动驾驶、室内导航和人机转移的观察,预测基于物理的未来视觉轨迹。这种统一的表述提供了三个有前途的应用方向:用于策略训练增强的合成数据生成、用于策略评估的可扩展虚拟环境以及用于下游机器人控制的语言引导规划信号。这是通过三部分设计实现的:a) 具有 MLLM 动作编码的双流 MMDiT,其中 60 层双流扩散 Transformer 通过逐层联合注意力将冻结的 Qwen2.5-VL 语义与视频 VAE 潜伏耦合起来; b) 具身世界知识(EWK),一个 860 万视频文本语料库(2 亿多帧),具有超过 20 多个实施例和 500 多个动作类别的动作语言映射; c) 通用+专家渐进课程,这是一种两阶段训练策略,首先学习通用视觉先验,然后在共享语言界面下注入具体化专业化。广泛的结果显示出强大的竞争力:在EWMBench和DreamGen Bench上总体排名第一,在WorldModelBench和PBench上优于所有开源模型。 RoboTwin-IF 基准的额外零样本分析进一步支持稳健的泛化和多视图一致性。