论文

从模拟中看到现实:用于视觉-语言-动作数据增强的高效视频传输

Seeing Realism from Simulation: Efficient Video Transfer for Vision-Language-Action Data Augmentation

模型训练合成数据

摘要

视觉-语言-动作(VLA)模型通常依赖于大规模的现实世界视频,而模拟数据尽管成本低廉且可高度并行收集,但通常会受到巨大的视觉域差距和有限的环境多样性的影响,导致现实世界的泛化能力较弱。我们提出了一种高效的视频增强框架,可将模拟的 VLA 视频转换为真实的训练视频,同时保留任务语义和动作轨迹。我们的管道通过视频语义分割和视频字幕从模拟中提取结构化条件,重写字幕以使环境多样化,并使用条件视频传输模型来合成逼真的视频。为了使增强在规模上实用,我们引入了一种扩散特征重用机制,该机制在相邻时间步上重用视频词元以加速生成,以及一种核心集采样策略,该策略可在有限计算下识别紧凑的非冗余子集以进行增强。在 Robotwin 2.0、LIBERO、LIBERO-Plus 和真实机器人平台上进行的大量实验证明了持续的改进。例如,我们的方法在 Robotwin 2.0 上将 RDT-1B 提高了 8%,在更具挑战性的 LIBERO-Plus 基准上将 $π_0$ 提高了 5.1%。代码位于:https://github.com/nanfangxiansheng/Seeing-Realism-from-Simulation。