论文

MotionJEPA:通过捕获潜在空间中的视觉变化来防止时间特征崩溃

MotionJEPA: Preventing Temporal Feature Collapse by Capturing Visual Changes in Latent Space

模型训练预训练

摘要

联合嵌入预测架构(JEPA)是一种有前途的范例,用于学习与任务无关的潜在世界模型,而无需视觉重建。然而,标准 JEPA 训练对慢速特征表现出强烈的归纳偏差,导致特征抑制和潜在表示的崩溃。虽然逆动力学提供了时间反崩溃,但它依赖于动作标签,并且几乎没有动机嵌入一般的、未标记的动力学。我们引入了差异图像和单图像嵌入正则化(DISReg),这是一种基于逆动态风格模块的新型正则化器,可以预测时间差异图像嵌入,而不会造成任何像素重建损失,从而鼓励平衡的静态和动态特征学习。 DISReg 由一个静态项和一个动态项组成,静态项形成图像嵌入的分布并鼓励慢速特征,动态项与嵌入的直接正则化不同,它不对图像嵌入的形状或分布施加任何限制,而是仅激励动态特征的存在。通过将此正则化器集成到标准 JEPA 中,我们建立了新的架构 MotionJEPA。潜在探测表明,MotionJEPA 比其他方法产生更完整的表示,并且我们的轨迹分析表明它保持了几何上简单的低曲率潜在嵌入。我们进一步表明,MotionJEPA 在四种环境中的静态背景干扰下提高了下游规划的成功率。