论文

WAXAL-NET:跨 19 种非洲语言微调边缘 ASR

WAXAL-NET: Finetuned Edge ASR Across 19 African Languages

模型评测模型能力评测

摘要

我们评估了针对 WAXAL 语料库中 19 种语言的紧凑型领域专用 ASR 模型是否能够优于大规模多语言基础模型。微调边缘模型的宏观平均 WER 为 $38.0\%$,而最佳零样本基线为 $64.9\%$,使用较小的模型 $3-40倍$ 可以减少 $26.9$ 个百分点。结果证实,领域专业化在非洲自发语音的规模中占主导地位。跨域评估表明,微调模型恢复了分布外 (OOD) 语音的可用性能,而当测试域与其预训练分布匹配时,零样本模型重新获得优势。对所有调查语言进行的分布式母语审核产生了基于语言的错误分类,表明 CTC 和自回归架构在不同语言家族中的行为有所不同。我们进一步表明,WER 本身就歪曲了音节文字语言的性能,其中 CER/WER 比率显示的字符级准确性比标题 WER 所建议的要高得多。最后,为了对未来的非洲 ASR 研究做出贡献,我们发布了所有模型权重、微调 和评估脚本,以及涵盖所有 19语言的清理后的 WAXAL 子集。