论文

解锁强有力的监管:通用音频 预训练 方法的以数据为中心的研究

Unlocking Strong Supervision: A Data-Centric Study of General-Purpose Audio Pre-Training Methods

模型训练合成数据

摘要

当前的音频 预训练 寻求学习广泛的音频理解任务的统一表示,但它仍然是碎片化的,并且从根本上受到其对弱、噪声和规模有限标签的依赖的瓶颈。借鉴Vision的预训练基础蓝图,我们认为音频领域必须首先建立自己的大规模、强有力的监管框架。我们引入了一种新的以数据为中心的管道,它利用高保真音频描述生成器来创建 SOTA 质量的音频描述,以及第一个连接语音、音乐和环境声音的统一标签系统 (UTS)。然后,我们在这些强大的源数据上对不同的 预训练 目标进行系统的比较研究。我们的实验表明,数据质量和覆盖范围是性能的主要驱动因素,而目标的选择决定了下游任务的专业化。