Qwen-VLA:跨任务、环境和机器人实施例统一视觉-语言-动作建模
Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
摘要
具身智能通常是通过针对单个任务(例如操纵或导航)的专用模型来研究的,从而导致跨任务、环境和机器人实施例的能力分散和有限的泛化。在这项工作中,我们研究异构的具体决策问题是否可以统一在单一视觉-语言-动作模型中。我们提出了 Qwen-VLA,这是一个统一的具体化基础模型,它通过基于 DiT 的动作解码器将 Qwen 的视觉语言建模堆栈从感知、理解和推理扩展到连续动作和轨迹生成。 Qwen-VLA 通过多种数据源的大规模联合预训练方法进行训练,包括机器人操作轨迹、人类自我中心演示、合成模拟数据、视觉和语言导航数据、以轨迹为中心的监督和辅助视觉语言数据。为了支持多个机器人平台,我们引入了实施例感知提示条件,其中机器人特定的文本描述指定了当前实施例和控制约定。我们进一步将操纵、导航和轨迹预测整合到一个统一的动作和轨迹预测框架中,从而实现跨机器人形态、任务族和环境的可转移视觉基础、空间推理和连续动作生成。操纵、导航和以轨迹为中心的基准测试的实验表明,在场景布局、背景、照明、对象配置和机器人实施例变化的情况下,具有一致的多任务性能和分布外泛化能力。 Qwen-VLA-Instruct 在 LIBERO 上实现 97.9%,在 Simpler-WidowX 上实现 73.7%,在 RoboTwin-Easy/Hard 上实现 86.1%/87.2%,在 R2R 上实现 69.0% OSR,在 RxR 上实现 59.6% SR,在实际 ALOHA 实验中平均 OOD 成功率为 76.9%,零样本率为 26.6% DOMINO 动态操纵取得成功。