论文

利用密集体现思想链监督训练视觉-语言-动作模型

Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision

摘要

视觉-语言-动作(VLA)模型中的跨实体迁移仍然具有挑战性,因为不同机器人平台的底层状态和动作空间存在根本差异。我们观察到,操作背后的高级认知过程,包括场景感知、对象识别、任务规划和子任务分解,在很大程度上是跨实施例共享的。基于这一观察,我们提出了 ZR-0,这是一个 26 亿参数的端到端 VLA 模型,它使用密集的体现思想链 (ECoT) 监督来对齐视觉语言模型 (VLM) 内的跨体现表示。 ZR-0采用双流架构:预训练的VLM(系统2)在训练期间生成结构化ECOT推理,而基于Diffusion Transformer的动作专家(系统1)通过流匹配产生连续的动作块。这两个组件通过交叉注意力耦合,注意力掩码限制动作专家仅输入提示特征,从而在推理时完全跳过 ECoT 生成,而不会造成任何性能损失。 ZR-0 在 ProcCorpus-60M 上进行预训练,ProcCorpus-60M 是一个大型数据集,包含来自超过 40 万个轨迹的约 6000 万帧(约 1,000 小时),密集的 ECoT 注释覆盖了所有帧的 96.8%。我们在涵盖单臂 (LIBERO)、双手 (RoboTwin 2.0) 和人形 (RoboCasa GR-1 Tabletop) 实施例的三个模拟基准以及 xArm 平台上的真实实验中评估 ZR-0,在所有设置下展示了强大的性能。代码和模型检查点可在 https://github.com/RUCKBReasoning/ZR-0 上找到。