论文
LeAVJEPA:视听自监督学习的极简架构
LeAVJEPA: A Minimalist Architecture for Audio-Visual Self-Supervised Learning
摘要
先前的视听自监督学习方法依赖于 EMA 目标编码器、预测头、重建解码器和对比损失等机制。我们介绍 LeAVJEPA,这是第一个在 LeJEPA 的无崩溃目标下训练的视听编码器。单个早期融合 Vision Transformer 处理音频、视频和联合音频-视频输入。模态丢失将缺失的模态视为同一事件的另一种视图,从而使跨模态对齐隐含在目标中。该模型将全局嵌入与特定于模态的局部嵌入对齐,并且 SIGReg 可以防止表征崩溃。受控的消融将模态丢失识别为视听对齐的关键机制。尽管架构简单,但在冻结评估下,LeAVJEPA 在 AudioSet-20K 上达到 36.0 mAP,在 ESC-50 上达到 91.3% 的准确度。 微调之后,在VGGSound上达到了61.1%的准确率,并且其嵌入支持零样本视听检索。