论文

阿拉伯语Whisper适配:方言路由、LoRA与模型融合

Itgan at NADI 2026 shared task: Parameter-Efficient Whisper Adaptation for Robust, Mixed-Dialect and Code-Switched Arabic ASR

模型训练模型优化应用与实践参数高效训练模型合并语音识别与转写

摘要

我们描述了 NADI 2026 的三个 ASR 子任务的 Itgan 系统,即强大的国家级 ASR (1.1)、混合方言 ASR (1.2) 和突尼斯语码转换 ASR (1.3)。这三者共享一个配方,Whisper 在消费级 GPU 上采用 LoRA 进行了调整,并且每一个配方都包含不同的附加内容。在 1.1 版本中,在测试时给出方言标签,每种方言专家从汇集的适配器中继续获得最大的收益,提交的系统达到了国家平均 WER 的 57.1%。冻结编码器上的后评估线性探针可以路由没有标签的话语,并恢复 Oracle 路由所提供内容的 44%。在 1.2 上,基本模型的选择比适配器容量更重要,只有在我们添加去相关成员后,系统组合才有帮助,达到 46.7% WER。在 1.3 上,我们的系统以 14.49% 的 WER 排名第二,在领先的提交中 CER 最低,为 5.38%。它最后的 0.60 WER 分数是在没有进一步训练的情况下获得的,主要来自独立训练运行的精确权重空间平均值,并通过 ROVER 投票添加剩余部分。每次比较都带有一个 配对引导测试,我们报告了八个不起作用的方向。