论文
LeVJEPA:无需启发式的高效且可扩展的视频预训练
LeVJEPA: Efficient & Scalable Video Pretraining without the Heuristics
摘要
视频承载着物理世界的时间结构,但从中学习表示的计算成本仍然很高:流行的自监督方法要么通过架构不对称、耦合指数移动平均目标编码器、停止梯度和容量有限的预测器来防止表示崩溃,要么通过在像素空间中重建屏蔽内容来规避它。我们介绍 LeVJEPA,这是第一个在 LeJEPA 的无崩溃目标下训练的视频编码器,它省去了这两者。单个编码器通过剪辑的全局和局部视图的不变性损失进行训练,并通过 SIGReg 进行正则化,从而通过可证明的保证排除崩溃。该架构简化为编码器和投影仪,目标简化为单个超参数。这个公式有两个性质。首先,预训练的成本取决于编码器观察到的词元数量;均匀的随机词元丢弃使得这个数字很小,同时提高了下游的准确性。在相同数据的匹配 epoch 中,LeVJEPA 在 ViT-S/B/L 上匹配或超过了 V-JEPA 2,预训练计算量减少了 5.6 至 20.8 倍,并且在匹配的总 FLOP 数下,它在 ImageNet-1K 上超出了最强视频基线 7.6 个点,同时在以运动为中心的基准上保持竞争力。其次,由于不需要分支之间的不对称性,因此可以使用块因果注意力来训练编码器,而无需可测量的准确性成本:时间排序成为编码器本身的属性。与在相同视频帧上训练的计算匹配的 DINOv2 相比,LeVJEPA 在以外观为中心的评估上接近图像预训练编码器,同时其以运动为中心的准确性几乎翻了一番。这些结果表明,一旦消除其计算开销,视频就成为可行的,并且在多个方面成为通用视觉预训练的首选基础。