论文

UniJEPA:用于与任务无关的视觉世界建模的统一联合嵌入预测架构

UniJEPA: A Unified Joint-Embedding Predictive Architecture for Task-Agnostic Visual World Modeling

模型训练预训练

摘要

联合嵌入预测架构(JEPA)已成为紧凑潜在空间中世界模型自监督学习的原则框架,但现有方法是支离破碎的:一些方法预测潜在空间中单个图像的遮蔽部分(I-JEPA),另一些学习预测全局光度变换(图像世界模型),而视频尺度 JEPA 预测未来的时间状态并针对动作条件规划进行后训练(V-JEPA~2、DINO-World、恐龙-WM)。这些目标被视为具有单独编码器、预测器和抗崩溃正则器的不同配方,阻碍了单一模型统一图像级和视频级世界建模。我们提出了 UniJEPA,一种统一的 JEPA,它在一个共享潜在空间中共同学习光度预测(图像级变换)和时间预测(视频级下一状态动态)。单个端到端目标由下一个嵌入预测损失和高斯正则化器组成,产生可证明的抗崩溃编码器-预测器对,可从原始像素进行训练,无需 EMA、停止梯度或预训练编码器。我们证明相同的潜在空间支持可控抽象:光度预测学习不变结构,而时间预测学习等变动力学。在离线轨迹上进行动作条件 后训练 后,UniJEPA 通过将目标特征视为预测目标来实现零样本规划。在图像、视频和控制基准方面,UniJEPA 可以匹配或超越特定于任务的 JEPA,同时需要单个损失超参数,并且在相当的精度下,计划速度比生成世界模型快数十倍。