论文

R2RDreamer:空间广义 2D 操作策略的 3D 感知数据增强

R2RDreamer: 3D-aware Data Augmentation for Spatially-generalized 2D Manipulation Policies

模型训练合成数据

摘要

空间泛化对于模仿学习的操纵策略至关重要,但实现它通常需要跨不同的物体姿势、机器人配置和相机视点进行缩放演示。来自一些源演示的数据增强为昂贵的现实世界收集提供了一种实用的替代方案。基于模拟的增强可以创建可控的变化,但需要复杂的环境和对象设置,并且可能会引入模拟与真实的差距。最近的真实到真实方法通过联合编辑来自真实演示的 3D 观察和动作轨迹来避免这些问题,但它们仍然依赖于强大的 3D 场景解析和几何补全,并且通常生成针对 3D 点云策略而不是基于 RGB 的 2D 策略定制的观察。我们提出了 R2RDreamer,这是一种真实到真实的演示增强框架,可以保留 3D 动作观察编辑的几何一致性,同时将视觉完成移动到 2D 视频空间。具体来说,R2RDreamer 首先通过在共享 3D 框架中编辑不完整的对象点云和末端执行器轨迹来执行轻量级 3D 增强;然后,它使用遮挡感知推理将编辑后的场景投影到遮罩图像空间控制视频中,并使用密集控制图像到视频模型来完成时间相干的 RGB 观察。使用 2D 扩散式策略和视觉语言动作策略进行的空间转移操作任务的实验表明,R2RDreamer 通过有限源演示改进了空间泛化,分析验证了 3D 编辑、遮挡感知投影和视频完成的贡献。