开源项目
facebookresearch/MJEPA:单一共享编码器统一音视频自监督学习的JEPA框架官方实现
facebookresearch/MJEPA
概述
MJEPA由Meta及合作研究者(Revant Teotia、Adrien Bardes、Nicolas Ballas等)发布,是论文(arXiv 2606.25225)的官方PyTorch实现,面向音视频理解与自监督表征学习研究者。方法上只用一个共享编码器和一个嵌入空间L1预测损失:模态内任务预测自身被掩码的表征,跨模态任务用一种模态预测另一种的池化表征,目标来自编码器的EMA副本并施加stop-gradient,总损失为3个模态内加6个跨模态项。核心结论:跨模态预测带来正迁移,去掉后共享编码器会退化到不如单模态基线;冻结特征优于既有SSL基线、接近全量微调,可自然扩展到1B参数ViT-g及音视频配对加纯视频的异构数据混合。资源有限的应用方可直接复用其冻结特征。