论文
同策略 多方言ASR自学蒸馏:掌握方言,保留普通话
On-Policy Self-Distillation for Multi-Dialect ASR: Mastering Dialects, Retaining Mandarin
摘要
最近的大规模 ASR 模型已经实现了很强的普通话识别精度,并且具有一定的中文方言识别能力。然而,它们的方言识别准确性在现实世界的语音中仍然有限。直接方言适应可以降低方言 CER,但也可能提高普通话 CER。因此,我们研究如何采用功能强大的 ASR 模型来提高多方言识别而不降低普通话识别能力。我们采用适应管道,其中连续的 预训练 (CPT) 和方言监督的 微调 (SFT) 提供了坚实的基础,而 同策略 Self-蒸馏 (OPSD) 作为最终的细化。 OPSD 通过在其自己的解码前缀上训练学生模型来解决自回归 ASR 中的训练-测试不匹配问题,而冻结的教师以参考成绩单作为特权上下文为条件,提供软 词元级 目标。这用 蒸馏 取代了方言数据的硬交叉熵更新,保留了普通话能力,同时改进了方言识别。我们使用 Qwen3-ASR-1.7B 实例化该框架,并在公共和内部普通话和方言测试集上对其进行评估。在匹配的细化数据和时间表下,OPSD 在不提高普通话 CER 的情况下提高了方言识别,而持续的教师强制 微调 则提高了普通话 CER。我们将发布模型权重和评估脚本。