论文

RoboRender:面向机器人视觉仿真到现实迁移的视频生成

RoboRender: Robot-Oriented Video Generation for Visual Sim-to-Real Transfer

模型训练应用与实践合成数据机器人内容创作

摘要

模拟可以生成大规模、低成本的机器人数据,但由于模拟与真实的视觉差异,在模拟中训练的策略通常无法转移到现实世界。现有方法通常依赖于中间表示,这可能会丢弃丰富的语义信息或在部署时需要额外的感知模块。我们使用 RoboRender 解决了视觉模拟与真实之间的差距,该框架可将模拟轨迹转换为逼真的 RGB 视频以进行策略学习。 RoboRender 以模拟深度视频、语言指令和机器人 RGB 掩模视频为条件训练面向机器人的视频生成模型,保留模拟器几何形状、机器人运动和动作标签,同时合成逼真的纹理、背景和干扰物。生成的 RGB 视频与模拟器提供的状态和操作配对,以训练零样本实际部署的策略。在机器人视频测试集上,我们的视频模型在生成质量方面优于深度条件视频生成基线。在涉及拾取放置、铰接式对象操作和移动操作任务的现实实验中,根据 RoboRender 生成的数据训练的策略实现了 71% 的平均成功率,分别优于原始模拟渲染和传统视觉域随机化约 7.1 倍和 3.6 倍。我们进一步表明,每个模拟轨迹生成的视频越多,政策绩效就会提高,从而将开放任务的成功率提高 65 个百分点。这些结果表明,生成视频渲染缩小了零样本策略传输的视觉模拟与真实差距。项目网站:https://robo-render.github.io/。