论文
VAG:用于具体数据合成的双流视频动作生成
VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis
摘要
基于大规模人类远程操作数据训练的机器人基础模型的最新进展使机器人能够执行日益复杂的现实世界任务。然而,扩展这些系统仍然很困难,因为收集特定任务的演示既昂贵又费力。合成数据,特别是生成的视频,提供了一个有前途的方向,但现有的世界模型(WM)并不直接适合政策学习,因为它们不提供配对的行动轨迹。世界动作(WA)模型通过视觉输出预测动作来部分解决这个问题,但通常缺乏强大的视频动作对齐,而首先生成视频然后推断动作的两阶段管道会导致效率低下和错误累积。为了解决这些限制,我们提出了 VAG,一种基于流匹配的统一双流框架,可在视觉和语言条件下联合生成视频和动作。通过同步两个分支中的去噪并使用自适应 3D 池化机制将紧凑的全局视频上下文传输到动作分支,VAG 提高了生成过程中的跨模式一致性。在模拟和现实世界的设置中,VAG 生成具有竞争性预测质量的对齐视频动作对,支持可执行轨迹重放,并提供有用的合成预训练数据,以改进下游策略泛化,表明其作为具体数据合成的实用世界动作模型的潜力。