论文

FSD50K-Solo:单源声音事件的自动管理

FSD50K-Solo: Automated Curation of Single-Source Sound Events

模型训练合成数据

摘要

高质量的训练数据集对于神经网络的性能至关重要。然而,音频领域仍然缺乏大规模、强标签、单源声音事件数据集。 FSD50K 数据集尽管相对较大且开放,但包含相当一部分多源样本,其中背景干扰或重叠事件可能会限制数据的有用性。为了应对这一挑战,我们引入了一个专为大规模开放音频语料库设计的数据管理框架。我们的方法利用生成扩散模型来合成干净的单类事件,以构建受控的噪声混合物进行监督。随后,我们采用预训练的音频编码器和判别分类器来自动识别和过滤多源样本。实验表明,我们的框架在人类专家策划的测试集上取得了出色的性能。最后,我们发布了 FSD50K-Solo,这是 FSD50K 的模型策划子集,其中包含由我们的方法识别的单源音频样本。除了 FSD50K 之外,我们的方法还建立了一个可扩展的范例来管理开源音频语料库。