论文

ReShoot:用于视觉运动策略学习的记录机器人演示的生成视觉域随机化

ReShoot: Generative Visual Domain Randomization of Recorded Robot Demonstrations for Visuomotor Policy Learning

模型训练合成数据

摘要

模仿学习的机器人策略经常过度适应训练演示中的视觉条件。因此,物体颜色或背景外观的变化通常会导致性能显着下降。常见的缓解策略是在每个新颖的视觉环境中获取额外的演示;然而,这种方法是资源密集型的,需要重复访问机器人、受控环境以及人工操作才能覆盖每种外观条件。我们引入了 ReShoot,这是一个框架,通过在改变的外观下重新渲染先前记录的演示来综合视觉多样性,从而将数据收集的负担转移到生成。视觉语言模型为场景添加字幕,编辑目标属性(例如背景、物体颜色或材质),边缘调节视频生成器重新渲染两个摄像机视图以匹配。该指令已相应更新。动作序列和本体感受轨迹被逐字复制而无需重新标记,因此每个生成的情节都保留了记录的动作和本体感受标签。在 LIBERO 上,在录制和重新渲染演示的同等混合上进行训练的策略与仅录制训练的性能相匹配(96.5% 与 96.9%)。此外,混合训练集提高了 LIBERO-Plus 对场景扰动的鲁棒性(85.5% vs. 82.3%)。在两个物理机器人平台上,部署具有 43 个和 100 个预先收集的演示的 ReShoot,将重新着色对象的成功率分别从 0.0% 提高到 42.9% 和 47.5%,同时保持原始记录外观下的性能。