论文

微调 Whisper 普什图语 ASR:策略和规模

Fine-tuning Whisper for Pashto ASR: strategies and scale

模型训练监督微调与指令调优

摘要

尽管普什图语是 CommonVoice 最大的语言库之一,但它却没有出现在 Whisper 的 预训练 语料库中,导致现成的模型无法使用:所有 Whisper 大小都在普什图语音频上输出阿拉伯语、达里语或乌尔都语脚本,实现了超过 100% 的单词错误率。我们比较了 CommonVoice Pashto v20 上的Whisper-base的四种 微调 策略:普通完整 微调、LoRA(秩为64)、冻结编码器(2/6 层)和多级乌尔都语到普什图语传输。我们将普通的 微调 扩展到 CommonVoice Pashto v24 上的 Whisper-small 和 Whisper-large-v3-turbo(113 小时)。 Vanilla 微调 在 CV20 上实现了 21.22% 的 WER,比 LoRA 好 33.36 pp,比冻结编码器好 14.76 pp,比乌尔都语传输好 44.56 pp。冻结编码器 微调 降低了 Whill-Base(6 个编码器层)的性能:层功能分离在此深度不成立,并且冻结会消除可训练能力的三分之一。由于未经验证的中间检查点、语音不匹配和训练不足,乌尔都语到普什图语的传输失败。在 CV24 上,whisper-small 实现了 24.89% 的 WER(在 3.3 倍参数下比 Whisper-base 提高了 2.24 pp); Whisper-large-v3-turbo 达到 23.37%(又提高了 1.52 个百分点)。收益递减表明耳语小是 113 小时的实际最佳值。与匹配训练相比,在线增强的 WER 优势提高了 7.25 个百分点。错误分析将词尾后缀混淆(阳性 -ay 与阴性 -a)和涉及普什图语独特辅音 /ts/ 的卷舌替换确定为主要失败模式。经过微调的检查点和评估脚本已在 HuggingFace 上发布。