论文

用于低资源班图语语音识别的声调条件课程学习

Tone-Conditioned Curriculum Learning for Low-Resource Bantu Speech Recognition

应用与实践语音识别与转写

摘要

南部班图语有超过 8000 万人使用,但当前的基础 ASR 模型仍然产生高于 100% 的零样本 WER,这限制了在教育和公共服务中的实际使用。我们通过针对 6 种南部班图语言的声调课程框架来解决这一差距,该框架结合了混合难度评分、声调统计驱动的门控适配器和分阶段课程训练。我们对社区语料库进行了训练,并测试了向 NCHLT 的转移,以衡量匹配评估之外的稳健性。结果显示,架构和语言之间存在明显的交互作用,W2V-BERT 在 Nguni 语言上的 WER 表现优于 Whisper 3 到 4 个 WER 点,而 Whisper 在 Sotho-Tswana 语言上的表现则更好。具有音调调节功能的 W2V-BERT 在整个数据集上的平均 WER 达到了 28.41%,在 Xitsonga 传输上达到了 23.79%。没有一个模型适合所有 6 种语言,因此部署应将每种语言的模型选择与跨语料库的验证配对。