论文

加纳语言青少年健康沟通自动语音识别 (ASR) 的基准测试和领域适应

Benchmarking and Domain Adaptation of Automatic Speech Recognition (ASR) for Adolescent Health Communication in Ghanaian Languages

模型训练监督微调与指令调优

摘要

本文介绍了一项针对三种加纳语言(契维语、达格巴尼语和埃维语)青少年健康交流的自动语音识别 (ASR) 端​​到端研究。这项工作分三个相互关联的阶段进行;首先,我们使用字符和单词错误率(CER、WER)在通用领域圣经语料库和青少年性与生殖健康(ASRH)领域 ASR 数据集上对五个 ASR 系统(三个特定语言的 Wav2Vec2 模型和两个多模态 LLM,Gemma 3n 和 Gemma 4)进行基准测试。其次,在基准的指导下,我们进行有监督的域适应:虽然 Gemma 4 是最强的零样本候选者,但事实证明对其进行微调在计算上是不可行的,因此我们转向紧凑的 Qwen3-ASR-0.6B,在大型加纳圣经语料库(约 90k 样本)上进行微调,并严格对保留的人类收集的域内音频进行评估。微调降低了每种语言的 WER,其中 Ewe 的 WER 最为显着(WER 从 109.3% 降至 64.8%,下降了 44.5 个百分点;CER 从 65.1% 降至 24.9%)。第三,我们通过 KasaHealth 验证工作,这是一个以所有三种语言部署的实时语音优先 ASRH 应用程序,并辅以技术评估工具 Senti-Check。 KasaHealth 接受了 50 名社区受访者的测试,获得了 100% 的聊天批准率、72% 的良好或优秀翻译评级以及 92% 的推荐率,同时也解决了最限制实际使用的领域差距。在所有三个阶段中,证据都趋于一致:对于这些语言,绑定约束是在域内数据中验证的,而不是模型能力或计算。