论文
AudioMosaic:对比屏蔽音频表示学习
AudioMosaic: Contrastive Masked Audio Representation Learning
摘要
音频自监督学习(SSL)旨在从大规模未标记音频数据中学习通用表示。虽然最近的进展主要是由生成重建目标推动的,但对比方法的探索仍然较少,部分原因是设计有效的音频增强的困难以及对比 预训练 所需的大批量。我们引入了 \textbf{AudioMosaic},一种基于对比学习的音频编码器,用于一般音频理解。在 预训练 期间,AudioMosaic 通过将结构化时频掩蔽应用于频谱图补丁来构造正对,从而减少内存使用并实现高效的大批量训练。与生成方法相比,AudioMosaic 编码器学习更具辨别力的话语级表示,这些表示表现出跨数据集、域和声学条件的强大可迁移性。大量实验表明,AudioMosaic 在线性探测和 微调 下的多个标准音频基准测试中均实现了最先进的性能。我们进一步表明,将预训练的 AudioMosaic 编码器集成到音频语言模型中可以提高音频语言任务的性能。该代码可在我们的 \href{https://github.com/HanxunH/AudioMosaic}{GitHub 存储库}中公开获取。