论文
Ethio-ASR:埃塞俄比亚语言的联合多语言语音识别和语言识别
Ethio-ASR: Joint Multilingual Speech Recognition and Language Identification for Ethiopian Languages
摘要
我们推出了 Ethio-ASR,这是一套基于 CTC 的多语言自动语音识别 (ASR) 模型,针对五种埃塞俄比亚语言进行了联合训练:阿姆哈拉语、提格里尼亚语、奥罗莫语、西达马语和沃莱塔语。这些语言属于亚非语系的闪米特语、库希特语和奥莫提语分支,尽管埃塞俄比亚绝大多数人口都使用这些语言,但在语音技术方面的代表性仍然严重不足。我们使用几个预先训练的语音编码器在最近发布的 WAXAL 语料库上训练我们的模型,并根据强大的多语言基线(包括 OmniASR)进行评估。我们的最佳模型在 WAXAL 测试集上的平均 WER 为 30.48%,优于参数少得多的最佳 OmniASR 模型。我们进一步对性别偏见、元音长度和辅音双生对 ASR 错误的贡献以及多语言 CTC 模型的训练动态进行了全面分析。我们的模型和代码库向研究社区公开。