论文

V-JEPA 政策:基于预测视觉潜伏构建有效的世界行动模型

V-JEPA Policy: Building Effective World-Action Models on Predictive Visual Latents

模型架构新型架构

摘要

世界动作模型 (WAM) 将未来视觉状态预测与动作生成结合起来。通过采用大规模预训练的视频生成器或图像编辑模型,最近的 WAM 的一个突出系列继承了预测知识和学习它的模型。我们询问大规模预测预训练引发的预测视觉潜在空间是否可以为有效的 WAM 学习提供足够的基础,而无需继承完整的预训练视觉生成模型。为了回答这个问题,我们引入了 V-JEPA 策略,这是一个在冻结的 V-JEPA 2.1 编码器的潜在空间上构建 WAM 的简单框架。指令条件的未来潜在预测器和流匹配动作专家在单个下游阶段从头开始共同学习,预测器的未来通知上下文键值状态调节动作生成。 V-JEPA 政策共有 0.9B 个参数,其中 0.6B 可训练,在 LIBERO、LIBERO-Plus 和 RoboCasa-GR1 上具有代表性的 WAM 和视觉-语言-动作基线,实现了具有竞争力的性能。比较相同下游框架和训练预算下的视觉基础,发现 V-JEPA 潜伏比判别性、重建性和视频理解导向的替代方案更有效,特别是在分布变化的情况下。除了特定于任务的学习之外,在没有动作标签的 DROID 视频指令对上预训练预测器并将其适应 WAM 可以在下游控制和分布外泛化方面产生巨大的收益。总之,这些发现建立了预测性视觉潜伏,作为从特定任务演示中进行有效 WAM 学习以及转移从更广泛的野外视频中获得的未来建模知识的基础。我们的代码可在 https://github.com/breez3young/VJEPA-Policy. 获取