论文

CRAFT:用于双手机器人数据生成的视频扩散

CRAFT: Video Diffusion for Bimanual Robot Data Generation

模型训练合成数据

摘要

双手机器人从演示中学习从根本上受到成本和现实世界数据狭窄的视觉多样性的限制,这限制了跨观点、对象配置和实施例的策略稳健性。我们展示了使用视频扩散 Transformer (CRAFT) 的 Canny 引导机器人数据生成,这是一种基于视频扩散的框架,用于可扩展的双手演示生成,可合成时间连贯的操作视频,同时生成动作标签。通过根据从模拟器生成的轨迹中提取的基于边缘的结构线索来调节视频扩散,CRAFT 产生物理上合理的轨迹变化,并支持跨越对象姿势变化、相机视点、照明和背景变化、跨实体传输和多视图合成的统一增强管道。我们利用预先训练的视频扩散模型将模拟视频以及模拟轨迹中的动作标签转换为动作一致的演示。从一些真实世界的演示开始,CRAFT 生成了大量、视觉上多样化的照片级真实感训练数据,无需在真实机器人 (Sim2Real) 上重放演示。在模拟和现实世界的双手任务中,CRAFT 比现有的增强策略和直接的数据缩放提高了成功率,证明基于扩散的视频生成可以大大扩展演示多样性并提高双臂操作任务的泛化能力。我们的项目网站位于:https://craftaug.github.io/