论文

通过资源感知的语音编码器混合打破多对多语音到文本翻译中的多语言诅咒

Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders

摘要

多模态 大语言模型 (MLLM) 在语音到文本翻译 (S2TT) 方面取得了巨大成功。然而,在处理多语言语音输入时,跨所有语言共享的单个语音编码器会遭受多语言性的诅咒:不同资源级别的语言争夺有限的表示能力,导致高资源性能很强,但低资源语音的性能大幅下降。为了解决这个问题并提高多语言一致性,我们提出了 MSRT,这是一种围绕资源感知混合语音编码器 (MoSE) 构建的新颖框架。 MoSE 使用显式语言路由器将每个话语分配给适当的专家编码器。冻结专家保留高资源语言能力,而可训练专家则适应并专门研究中资源和低资源语言。我们进一步引入了五阶段课程学习策略,可大大减少数据依赖,每种语言仅需要 10 小时的配对 S2TT 数据即可实现有效对齐。我们对 45 种语言进行了广泛的实验,系统地评估了所有 45×44的翻译方向。我们的 4B 参数模型实现了最先进的性能,远远优于更大的基线。实证分析表明,MoSE 同时改进了高、中、低资源语言,其中低资源语音的收益最大,从而在不影响高资源性能的情况下打破了多语言的魔咒。为了支持未来的多语言 S2TT 研究,我们发布了我们的代码和模型。