论文

AtomEgo:探索实体基础模型预训练的自我机器人集成

AtomEgo: Exploring Ego-Robot Integration for Embodied Foundation Model Pretraining

模型训练预训练

摘要

实体基础模型受到机器人演示的有限规模和多样性的限制,激发了大规模以自我为中心的人类交互数据的使用。然而,由于人类和机器人之间存在巨大的体现和动作空间差距,如何有效地将这些数据合并到体现模型预训练中仍然不清楚。我们推出了 AtomEgo,这是一项关于自我与机器人协同训练的系统研究,由大约 2,659 小时的精选语料库和可扩展的数据处理管道支持。在视觉-语言-动作和世界-动作模型架构中,我们研究了三种代表性范式:与特定领域动作头的联合协同训练,通过实施例对齐进行渐进式自我到机器人转移,以及联合视频-动作建模。我们通过多任务真实机器人实验和语言条件跨实施例表示分析来评估这些范例。我们的结果揭示了一个简单的原则:数据规模 * 对齐质量 --> 能力增益;以自我为中心的数据可以提高泛化能力,但它们的价值取决于它们的对齐和利用效率。这一原则可以为可扩展的自我机器人预训练提供实用指导。