论文

HARNESS:轻量级蒸馏阿拉伯语音基础模型

HARNESS: Lightweight Distilled Arabic Speech Foundation Models

摘要

大型自监督语音 (SSL) 模型可实现强大的下游性能,但其尺寸限制了在资源受限环境中的部署。我们推出了 HArnE​​SS,这是一个以阿拉伯语为中心的自监督语音模型系列,通过迭代自 蒸馏 从头开始​​训练,以及轻量级学生变体,可在自动语音识别 (ASR)、方言识别 (DID) 和语音情感识别 (SER) 上提供强大的准确性与效率权衡。我们的方法从一位大型阿拉伯语-英语双语教师开始,逐步将其知识提炼成压缩的学生模型,同时保留与阿拉伯语相关的声学和副语言表示。我们进一步研究基于PCA的教师监督信号压缩,以更好地匹配浅薄学生的能力。与 HuBERT 和 XLS-R 相比,HArnE​​SS 持续提高了阿拉伯语下游任务的性能,而压缩模型在大幅结构减少的情况下仍然具有竞争力。这些结果使 HArnE​​SS 成为现实世界语音应用程序的实用且易于访问的以阿拉伯语为中心的 SSL 基础。