论文
Wh0:生成世界模型作为以自我为中心的人手操作数据的可扩展来源
Wh0: Generative World Models as Scalable Sources of Egocentric Human Hand Manipulation Data
摘要
扩展灵巧操作需要跨对象、场景和任务进行泛化,但现有数据源面临规模和场景/实施例对齐之间的权衡:远程操作数据与机器人部署很好地对齐,但收集成本昂贵;模拟具有可扩展性,但受到模拟与真实差距的限制;真实的以自我为中心的视频可以有效扩展,但与机器人部署仍然不一致。我们提出了 Wh0,一个框架,它使用生成视频世界模型作为以自我为中心的人手操作数据的可扩展且可控的来源,以解锁预先训练的灵巧 VLA 模型的操作能力。以语言、物体和场景为条件,Wh0 使用生成世界模型来生成 WM-H,这是一个 5 万集的以自我为中心的人与物体交互视频的数据集。然后 Wh0 通过手部动作重建和视觉编辑将生成的视频转换为机器人可训练的监督。 WM-H 与有限数量的真实机器人数据进行联合训练,使预训练的 VLA 模型适应灵巧的操作部署。在 18 个现实世界的灵巧操作任务中,与仅在机器人数据上进行后训练的模型相比,Wh0 将未见过的任务的零样本成功率从 8.3% 提高到 38.9%。消融研究进一步表明,可扩展的生成和场景/实施例对齐是性能提升的关键驱动因素。视频和开源代码可以在我们的项目网站上找到:https://chenyt31.github.io/wh0.github.io/。