论文

S-SONDO:面向通用音频基础模型的自监督知识蒸馏

S-SONDO: Self-Supervised Knowledge Distillation for General Audio Foundation Models

摘要

通用音频基础模型近来取得了显著进展,能够在多样任务上实现强劲表现。然而,最先进的模型仍然极其庞大,通常拥有数亿参数,导致推理成本高昂、在边缘设备上的可部署性受限。知识蒸馏是一种已被验证的模型压缩策略,但音频领域的既往工作大多聚焦于有监督设置,依赖类别 logits、中间特征或架构特定技术。这类假设将只输出嵌入的模型排除在外,例如自监督模型或度量学习模型。我们提出 S-SONDO(Self-Supervised KnOwledge DistillatioN for General AuDio FOundation Models),首个仅使用输出嵌入来蒸馏通用音频模型的框架。由于无需 logits 或层级对齐,S-SONDO 与架构无关,可广泛适用于基于嵌入的教师模型。我们将两个音频基础模型蒸馏为三个体积最多小 61 倍的高效学生模型,同时保留高达 96% 的教师性能,以此证明其有效性。我们还提供了关于损失选择与基于聚类的均衡数据采样的实用见解。代码见:https://github.com/MedAliAdlouni/ssondo。

S-SONDO:面向通用音频基础模型的自监督知识蒸馏:论文配图
图2:bds聚类数量的消融实验,对比不同簇数下的性能表现,固定虚线为随机采样基线。