论文

Marco-MoE:具有高效升级的开放多语言混合专家语言模型

Marco-MoE: Open Multilingual Mixture-of-Expert Language Models with Efficient Upcycling

摘要

我们推出 Marco-MoE,一套完全开放的多语言稀疏专家混合 (MoE) 模型。 Marco-MoE 采用高度稀疏的设计,其中每个输入词元仅激活总参数的大约 5%。这种极端的稀疏性与密集模型的升级相结合,可以在 5T 词元上实现高效的 预训练。我们的模型在英语和多语言基准测试中超越了类似规模的竞争对手,实现了一流的性能计算比。我们进一步对这些模型进行后训练,以创建 Marco-MoE-\textsc{Instruct} 变体,其性能超过了拥有 $3$-$14\times$ 激活参数的竞争模型的性能。我们的分析表明,Marco-MoE 学习跨相关语言共享的结构化专家激活模式,同时保持对语言隔离的高度专业化的利用。我们进一步表明,Marco-MoE 允许可扩展的语言扩展,而不会受到密集模型典型的干扰。为了支持社区,我们公开了完整的训练数据集、配方和模型权重。