论文

USAD 2.0:用于通用音频理解的缩放表示 蒸馏

USAD 2.0: Scaling Representation Distillation for Universal Audio Understanding

摘要

音频编码器对于现代音频应用至关重要,因为 大语言模型 (LLM) 越来越依赖单个编码器来实现不同的输入。虽然自监督学习 (SSL) 已经产生了强大的特定领​​域编码器,例如语音或音乐专家,但 USAD 和 SPEAR 等多领域方法在覆盖范围和评估方面仍然有限。最近的研究还表明,监督编码器与音频 LLM 更好地保持一致。我们推出了 USAD 2.0,这是一种集成了 SSL 和监督基础模型知识的通用编码器。 USAD 2.0 引入了域感知 蒸馏 来解决教师不匹配问题,将覆盖范围扩展到音乐领域,并添加了第二阶段监督 蒸馏 供下游使用。我们通过深度缩放进一步将模型扩展到十亿个参数。实验表明 USAD 2.0 在探测和基于 LLM 的评估中实现了强大或最先进的性能。