论文

视频 JEPA 的分解潜在动力学:辅助目标的实证研究

Factorized Latent Dynamics for Video JEPA: An Empirical Study of Auxiliary Objectives

模型训练预训练

摘要

联合嵌入预测架构 (JEPA) 是一种很有前途的自监督视频表示学习框架,但小规模视频 JEPA 训练中辅助目标的行为尚未得到很好的表征。我们报告了针对 Video-JEPA 的 18 个辅助目标变体的小规模实证研究,涉及两种预训练方案:单一数据集 (UCF-101) 和混合数据集 (UCF-101 + Something-Something V2 + ImageNet-100)。我们在三个互补基准上评估冻结表示:Diving-48(细粒度运动)、SomethingSomething V2(时间推理)和 ImageNet-100(外观)。我们的实验表明,许多辅助目标表现出容量权衡:一种下游能力的增益通常与另一种下游能力的退化同时发生。然后,我们研究 FWM-HW-LD(具有硬区域加权潜在动力学的因子化世界模型),这是一种训练时间目标,它将潜在表示分离为外观和动力学子空间,并将硬区域加权应用于 JEPA 预测误差和潜在动力学误差。在我们的混合数据集设置中,相对于参考基线,FWM-HW-LD 将 ImageNet-100 提高了 +5.92 个百分点,将 SSv2 提高了 +3.21 个百分点,同时在 Diving-48 上保持在 0.30 个百分点以内。这些结果表明潜在因式分解是研究 Video-JEPA 中辅助目标权衡的有用方向。