论文
MoLGE:语言组专家的混合,用于有效扩展大规模多语言语音识别
MoLGE: Mixture of Language Group Experts for Efficient Scaling of Massively Multilingual Speech Recognition
摘要
涵盖数百种语言的大规模多语言自动语音识别 (ASR) 模型必须在不同的语言和声学条件下保持稳健的性能。然而,这些模型经常遇到多语言的诅咒,即模型容量在不同语言之间被稀释。为了应对这一挑战,我们提出了基于语音自我监督模型(S3Ms)的语言组专家混合(MoLGE)。 MoLGE 将专用专家模块分配给相似语言的集群,与传统的特定语言专家混合 (MoE) 方案相比,减少了所需子模块的数量。它将分层低秩适应 (LoRA) 策略进一步集成到 S3M 架构的分离声学和语言组件中,从而能够对特定于语言的特征进行高效建模,同时保持参数效率。此外,我们研究了基于语言和数据驱动标准的语言分组策略对整体性能的影响,为语言结构如何影响多语言语音系统的可扩展性提供了可解释的视角。在实验中,我们在涵盖 495 种语言的多语言基准上评估 MoLGE。结果表明,MoLGE 始终优于密集多语言基线,并且可训练参数的增加最小。值得注意的是,这些语言分组策略为 ASR 建模的语音和拼写方面带来了显着的改进。我们的研究结果表明,结构化语言专业化为大规模扩展多语言 ASR 的语言覆盖范围提供了有效途径。