论文
语言专业多教师 同策略 蒸馏 用于多语言 LLM 基于 ASR
Language-Specialized Multi-Teacher On-Policy Distillation for Multilingual LLM-Based ASR
摘要
基于 LLM 的现代 ASR 系统已将多语言能力作为标准功能,利用大规模多语言语料库和 LLM 的跨语言知识来实现跨多语言基准的竞争性能。然而,对具有异构声学、语音和词汇特征的语言进行联合建模不可避免地会引入优化冲突,从而破坏语言方面的专业化。为了应对这一挑战,我们提出了语言专业多语言教师 同策略 蒸馏 (LS-MOPD),它将语言特定知识获取与多语言能力集成解耦:语言专业教师通过强化学习 (RL) 独立优化,然后通过语言路由和 词元级 多语言教师 蒸馏 将他们的专业知识整合到通才多语言学生中,从而减少直接的跨语言优化冲突。我们进一步探索静态和动态声学前缀配置,以检查师生前缀一致性如何影响 同策略 蒸馏 的功效。涵盖普通话、普通话子方言、粤语和英语的基准实验表明,LS-MOPD 大大优于 RL 基准,并超过了几乎所有基准上表现最好的 RL 教师定义的经验表现范围,揭示了其在多语言 ASR 方面超越所有教师的潜力。