论文
HumanScale:以自我为中心的人类视频在具体预训练方面的表现优于真实机器人数据
HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining
摘要
实体基础模型预计将受益于 大语言模型 等数据扩展,但面临更严格的数据瓶颈。由于其精确的动作监督和实施例对齐,远程操作的真实机器人轨迹仍然是主要的预训练来源,但其可扩展性受到高收集成本、获取难度以及低行为和环境多样性的限制。这些限制引发了人们对以自我为中心的人类视频的兴趣,将其作为一种可扩展、成本大幅降低且更加多样化的实体模型预训练替代方案。然而,与远程操作的真实机器人数据相比,其有效性仍未得到充分探索。为了解决这个问题,我们进行了一项系统研究,在固定的 后训练 和验证协议下,比较以自我为中心的人类视频和远程操作的真实机器人轨迹作为具体基础模型的预训练数据源。令人惊讶的是,我们发现以自我为中心的数据在通过精心设计的过滤和标记管道进行处理时,不仅可以替代模型预训练,而且可以带来卓越的性能。在相同数量的预训练数据下,基于自我中心数据进行预训练的模型在真实机器人动作预测上的验证损失降低了 24%,在分布内和分布外真实机器人任务执行上的成功率分别提高了 52.5% 和 90%。这一发现验证了具体基础模型的可扩展范式:对以自我为中心的人类视频进行预训练,以学习不同的世界表征,然后使用少量标记的真实机器人数据进行调整,以实现动作空间对齐。我们希望这项研究能够鼓励对以自我为中心的数据进行更广泛的探索,并在昂贵的机器人数据收集之前为数据质量评估提供指导。