论文

JEPA-WAM:通过联合嵌入世界建模学习视觉-语言-行动策略

JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling

模型训练监督微调与指令调优

摘要

鲁棒的机器人控制受益于明确的状态转换建模,但视频生成世界动作模型(WAM)会带来大量的部署成本。现有的潜在 WAM 避免了显式的未来生成,但通常会压缩预测表示或将预测建模与用于动作生成的表示分开。我们引入了 JEPA-WAM,这是一种构建在预训练 V-JEPA 空间中的潜在 WAM,它通过共享预测器将潜在转换预测与连续动作生成结合起来。 JEPA-WAM 预测一个空间结构的联合当前-未来目标,该目标捕获当前和未来观察之间的任务共享视觉时间结构,同时保留密集的补丁级对应关系。通过共享预测器,转换监督直接塑造主干,从中提取专用表示以进行动作预测。相同的设计也可以在预训练的 VLA 策略中实例化,同时保留其原始的感知和行动路径。在 LIBERO-Plus 上,JEPA-WAM 达到了 79.2%,这是没有大规模机器人策略预训练的最佳结果,而其预训练的 $π_{0.5}$ 实例化达到了 86.3%,实现了最好的整体性能。 RoboTwin 2.0 和现实世界的双手操作实验进一步证明了在视觉和空间变化下的强大泛化能力。