论文
Mix-MoE:通过混合 MoE 改进 大语言模型 的多语言机器翻译
Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs
摘要
即使双语监督有限,大语言模型 (LLM) 在多语言机器翻译 (MT) 方面也显示出巨大的前景。然而,具有并行语料库的 微调 LLM 提出了重大挑战,即参数干扰。为了解决这些问题,我们提出了 Mix-MoE,这是一个混合专家混合框架,旨在训练 LLM 进行多语言 MT。我们的框架分两个不同的阶段运行:(1) 使用 MoE 在单语语料库上进行后预训练,以及 (2) 使用 MoE 在平行语料库上进行后预训练。至关重要的是,我们将 MoE 层分为两个专门组:语言模型专家(LM 专家)和机器翻译专家(MT 专家)。 LM Experts 旨在捕获和保留预训练 LLM 所学到的单语知识。另一方面,机器翻译专家经过专门培训,可以获取和存储双语翻译知识。此外,为了促进这些专业专家之间的有效交互并利用文本中潜在的底层结构模式,我们引入了一种由从模型表示派生的傅里叶变换特征增强的路由机制。实验结果表明,Mix-MoE 在多语言 MT 方面表现出色,显着优于现有基线,并在减轻参数干扰方面取得了显着进展。