论文

MJEPA:用于视听学习的简单且可扩展的联合嵌入预测架构

MJEPA: A Simple and Scalable Joint-Embedding Predictive Architecture for Audio-Visual Learning

模型训练预训练

摘要

来自大规模视频数据的自我监督学习已成为视觉表示学习的主导范例。由于音频和视频流自然地在视频数据中同时出现,因此将这一成功扩展到从两种模式中共同学习是自然而然的下一步,但它仍然具有挑战性。现有的视听自监督方法依赖于特定模态的编码器和对比或重建目标的复杂组合,限制了跨模态协同和可扩展性。联合嵌入预测架构(JEPA)提供了一种简单的、与模态无关的替代方案,但迄今为止主要应用于单个模态。我们引入了 MJEPA,这是一种用于视听学习的联合嵌入预测架构,它对两种模式使用单个统一的编码器。我们的方法仅使用单一的预测目标,应用于模式内部和跨模式。我们表明,跨模态预测至关重要:没有它,共享编码器的性能会降级到单模态基线以下;有了它,每种模态的表示都可以从另一种模态中受益。我们的冻结 ViT-g 模型在 AudioSet-20K 上的性能优于之前最好的冻结基线超过 6.8 mAP,超过了 ESC-50 和 FSD50K 上完全微调的模型,并且尽管使用的视频数据少了 10 倍,但在视频基准测试中仍具有竞争力。