论文

通过混合专家和动态下采样增强基于 LLM 的多语言 ASR

Enhancing Multilingual LLM-based ASR with Mixture of Experts and Dynamic Downsampling

摘要

大语言模型(LLM)的快速进展开辟了自动语音识别(ASR)的新领域,使它们的有效集成成为关键且具有挑战性的研究方向。为此,这项工作提出了一种基于投影仪的 LLM-ASR 框架,针对多语言泛化和模态对齐的关键挑战。我们的方法采用了专家混合 (MoE) 架构来提高跨语言适应性,以及用于动态下采样和模态对齐的连续集成和激发 (CIF) 机制。实验结果表明,这些组件的组合产生了显着的性能改进,超越了强大的基线模型。所提出的方法代表了朝着构建更准确、更稳健和更通用的基于 LLM 的 ASR 系统迈出了一步。