论文

Qwen-RobotManip 技术报告:对齐解锁机器人操纵基础模型的规模

Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models

模型训练预训练

摘要

语言和多模态的基础模型通过在统一的公式和大规模训练下对齐异构数据来实现强泛化。在本报告中,我们研究了这种缩放方法是否可以应用于机器人操作以实现真正的泛化。这是具有挑战性的,因为与文本不同,操作数据本质上是异构的,收集成本昂贵,并且多样性狭窄,使得同时对齐和缩放变得困难。我们提出了 Qwen-RobotManip,这是一个基于 Qwen-VL 构建的通用视觉-语言-动作基础模型。 Qwen-RobotManip 在操作的表示、运动和行为维度上引入了统一的对齐框架,使大规模多源训练保持一致而不是冲突。这种对齐能力反过来又使 Qwen-RobotManip 能够吸收以前的训练机制无法维持的规模的操作数据。人机合成管道将以自我为中心的手部演示转换为跨 15 个平台的机器人轨迹,严格的管理管道协调异构数据集。 Qwen-RobotManip 仅使用开源数据集和人类视频,无需专有数据收集,构建了约 38,100 小时的预训练语料库,并展现了新兴的泛化能力,包括零样本指令跟踪、扰动鲁棒性、反应性错误恢复和跨实体传输。我们发现标准基准测试无法捕获预训练质量,而是采用 OOD 设置,包括 RoboCasa365、LIBERO-Plus、EBench、RoboTwin-Clean2Rand、RoboTwin-IF 和 RoboTwin-XE。 Qwen-RobotManip 在所有 OOD 设置中均大幅优于先前最先进的模型(包括 $π$0.5),在 RoboChallenge 中排名第一,相对提升了 20%,并在包括 AgileX ALOHA、Franka、UR 和 ARX 在内的真实机器人平台上进行了验证。