论文
数据选择对法国视听广播音频表示自监督学习的影响
Data Selection Effects on Self-Supervised Learning of Audio Representations for French Audiovisual Broadcasts
摘要
音频和语音自监督编码器模型现在广泛用于许多不同的任务。其中许多模型通常是在干净的分段语音内容(例如 LibriSpeech)上进行训练的。在本文中,我们研究了此类 SSL(自监督学习)模型的预训练数据集如何影响其下游结果。我们构建了一个包含高度多样化的电视和广播音频内容的大型预训练语料库,并使用自动工具进行描述。我们使用这些注释来构建较小的子集,用于训练音频 SSL 模型。然后,我们在多个下游任务上评估模型,例如自动语音识别、语音活动和音乐检测或说话人识别。结果显示了在不同音频内容上预训练 SSL 模型的潜力,而不将其限制为语音。我们还执行成员推理攻击来评估编码器记忆训练数据集的能力,这凸显了重复数据删除的重要性。这种统一的训练可以在语音和音乐机器学习社区之间架起桥梁。