论文
VLAFlow:通过协同训练和未来潜在对齐的视觉-语言-动作模型的统一训练框架
VLAFlow: A Unified Training Framework for Vision-Language-Action Models via Co-training and Future Latent Alignment
摘要
视觉语言动作模型(VLA)最近已经实现了先进的机器人操作,但不同机器人数据 预训练 范式的效果仍然难以比较,因为现有模型通常在架构、数据、动作空间和评估协议方面存在差异。我们提出了 VLAFlow(视觉-语言-动作流),这是一个统一的流匹配框架,用于 VLA 训练目标的受控比较。使用异构机器人语料库 OXEMix(包含来自 DROID、OpenX-Embodiment、OpenX-Augmented 和 RoboCOIN 的约 5,000 小时数据),我们在相同 pi0 式架构、共享 VLM 主干、动作专家和 14 维动作空间下评估四种范式:仅动作建模 (MindPI)、语言监督协同训练 (MindLPI)、未来潜在对齐(MindWPI) 及其组合 (MindLWPI)。在 LIBERO、LIBERO-Plus 和 SimplerEnv 上的实验表明,仅操作 预训练 对异构数据敏感。相反,语言监督有助于保持视觉语言泛化,而未来的潜在对齐则改善状态转换和行动结果建模。通过结合这两个信号,MindLWPI 在基准测试中实现了最稳定的整体迁移表现。这些结果提出了一种元动作空间观点:语言和未来的潜在表示提供了互补的中间约束,使异构动作监督更平滑、更可转移。