论文
DONDO:开放非洲语言的 w2v-BERT 语音识别基础模型
DONDO: Open w2v-BERT Speech-Recognition Base Models for African Languages
摘要
我们推出了 DONDO,这是一个开放的、经过许可许可的非洲语言自动语音识别 (ASR) 基本模型系列,基于 w2v-BERT 2.0 自监督语音编码器构建。 DONDO 包含 21 个单语言模型和 5 个多语言模型,涵盖加纳、塞拉利昂、尼日利亚、塞内加尔、肯尼亚和津巴布韦的 27 种语言。模型主要根据从宗教文本中提取的朗读语音进行微调,这些语音为缺乏转录音频的语言提供了广泛、许可清晰且拼写一致的覆盖范围。我们描述了一种两步(对于一个家庭,三步)学习率退火 微调 程序,该程序首先以高学习率适应共享多语言模型,然后对其进行退火以恢复并在某些情况下超越强大的单语言基线。我们进一步描述了一种轻量级语言调节机制,该机制将单热语言身份注入为声学特征之前的一系列前缀帧,从而允许在推理时将单个多语言检查点引导到目标语言。在五个多语言家族中,退火模型的平均单词错误率 (WER) 达到 10-13%,缩小了与单语言模型的大部分差距,同时在单个检查点中涵盖了多种语言。所有模型均在 Apache-2.0 许可证(仅限归属)下在 Hugging Face KhayaAI 组织上发布,以便其他人可以自由地对其进行微调,包括用于商业用途。我们保守估计,所涵盖的语言约有一亿人使用第一语言,如果包括第二语言的使用,则数量要多得多。