论文
RoboDream:用于可扩展机器人数据合成的组合世界模型
RoboDream: Compositional World Models for Scalable Robot Data Synthesis
摘要
扩展机器人学习需要大规模、多样化的演示,但通过远程操作收集现实世界的数据仍然极其昂贵且耗时。虽然视频扩散模型为数据缩放提供了一种有前途的途径,但现有的生成方法通常仅限于表面视觉增强,或者遭受产生物理上不可行的运动的具体幻觉。我们提出了一个可推广的以实施例为中心的世界模型,该模型通过在新颖的场景中并从新颖的角度将逼真的演示与新颖的对象合成来实现可扩展的数据生成。我们的方法将生成锚定为渲染的机器人运动,同时以显式场景和对象先验为条件,有效地将轨迹执行与环境合成解耦。这种公式有可能释放两个强大的数据扩展功能:(1)检索和重生,将现有轨迹重新调整到全新的环境中,而无需新的运动数据; (2)无道具遥控操作,操作员操纵空空气,模型随后产生目标物体和场景的幻觉,从而消除了重置时间。我们通过现实世界的实验证明,我们生成的数据能够持续改善下游策略性能,并显着降低各种操作任务的实际数据需求。