论文
用于 Mizo 自动语音识别的语音语料库:Whisper 和 SraVaani 1.0 微调 以及形态感知评估
A Speech Corpus for Mizo Automatic Speech Recognition: Whisper and SraVaani 1.0 Fine-Tuning with Morphology-Aware Evaluation
摘要
本研究报告了使用 Mizo(一种低资源语言)开发的自动语音识别 (ASR) 系统。开发包括收集 17.62 小时的语音数据、对其进行整理,以及 微调 Mizo ASR 系统,该系统具有三个 Whisper 多语言模型和 SraVaani 1.0 印度语多语言模型。 Whisper-large-v3 实现了最低的传统 WER (18.08%),而形态感知评估的 WER 为 7.22%。 SraVaani 1.0 印度语多语言模型的零样本评估产生了 58.27% 的 WER,而 Mizo 特定的 微调 将传统 WER 降低到 29.45%,形态感知 WER 降低到 17.93%。结果表明,即使在适应一种看不见的语言时,Whisper 模型也能实现相当低的 WER。相比之下,SraVaani 1.0 在其多语言模型中支持 Mizo 语言;然而,带有精心策划的 Mizo 语音数据的 微调 大大提高了其性能。