论文
尼泊尔语自动语音识别多语言预训练模型对比分析
Comparative Analysis of Multilingual Pre-trained Models for Nepali Automatic Speech Recognition
摘要
多语言预训练模型名义上支持尼泊尔语,但没有受控基准在单个 微调 协议下对它们进行比较。我们使用相同的预处理在 OpenSLR SLR54 尼泊尔语语料库(约 165 小时)上对涵盖 CTC 自监督、自回归编码器-解码器和混合 Conformer-CTC 架构的六个预训练模型(XLSR-53、IndicWav2Vec、MMS-1B、Whisper-Medium、Whisper-Large-v3-Turbo 和 Conformer-Hi)进行微调,分割、优化器和家庭匹配的学习率计划。我们在三个独立测试集(OpenSLR、FLEURS、Common Voice)上评估字错误率 (WER)、字符错误率 (CER) 和实时因子 (RTF)。尽管存在 9 倍的参数差距和 40 倍的预训练数据差距,Whisper-Large-v3-Turbo (14.76% WER) 和 IndicWav2Vec (14.89% WER) 并列第一,这提供了直接的经验证据,表明预训练中的语言家族接近度可以替代域内尼泊尔语的原始规模。在相同精度下,CTC 解码器的运行速度比自回归 Whisper 快 29 倍,从而在任何延迟预算下将实际部署偏好转向 CTC。大规模多语言预训练 (MMS-1B) 在 FLEURS 上产生最小的域外降级(+12.55 pp),这表明规模购买的是鲁棒性,而不是峰值域内准确度。由此产生的基准为尼泊尔 ASR 提供了第一个标准化、多模型、注重效率的参考数字。