论文

ACE-Ego-0:统一以自我为中心的人类和机器人数据以进行 VLA 预训练

ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining

模型训练预训练

摘要

视觉-语言-动作(VLA)模型受益于大规模和多样化的具体数据,但扩展机器人轨迹收集成本高昂且劳动密集型。最近的进展表明,大规模以自我为中心的人类视频在预训练中提供了补充的现实世界监督。然而,由于动作空间、实施结构、时间动态和监督质量的差异,人类和机器人数据的联合训练仍然具有挑战性。我们推出了 ACE-EGO-0,这是一个联合利用异构数据源的统一 VLA 预训练框架。为了从以自我为中心的人类视频中提取大规模预训练监督,我们构建了一个可扩展的以自我为中心的视频到动作管道,将原始人类视频转换为机器人格式的伪动作轨迹。为了使这些标签与机器人演示具有可比性,ACE-EGO-0 使用基于相机空间动作、形态条件和时间对齐动作分块的统一动作表示。为了稳健地利用以自我为中心的人类视频中的噪声伪动作监督,我们制定了一个具有可靠性意识的训练目标,其中包含人类辅助损失,将监督集中在可靠信号上。我们在 4530 小时的机器人和模拟数据以及 148000 小时的伪动作标记的以自我为中心的人类数据上实例化 ACE-EGO-0。实验表明,在可靠性感知加权下结合大规模人类监督可以持续改善统一联合预训练和监督 微调。 ACE-EGO-0 在 RoboCasa GR1 TableTop 和 RoboTwin 2.0 上实现了最先进的性能,同时展示了向现实世界双手操作的强大迁移。