论文

利用混合专家模型中的路由动态实现高效的语言适应

Leveraging Routing Dynamics in Mixture-of-Experts Models for Efficient Language Adaptation

模型训练参数高效训练

摘要

专家混合 (MoE) 模型广泛用于扩展语言模型,但其在多语言环境中的专家路由行为和适应性仍未得到充分探索。在这项工作中,我们研究了多语言语料库上以英语为中心的 MoE 模型连续 预训练 期间的多语言路由动态,分析专家使用情况在不同语言之间的差异。我们发现,持续的多语言 预训练 会导致早期和中间层中的分散的、与语言无关的路由,而语言专业化主要出现在最后的层中。我们还表明,语言之间的 词元级 词汇重叠在语言的路由方式中起着重要作用。受这些发现的启发,我们提出了一种参数有效的适应策略,可以更新最终 MoE 层中特定语言和共享的专家。 MultiBLiMP 和 Belebele 上的实验表明,我们的方法实现了强大的性能与效率权衡,获得了相对于 微调 完整最终层的竞争性能,同时更新了不到 2% 的参数。总体而言,我们的研究结果提供了关于在持续的 预训练 期间 MoE 中语言专业化在何处以及如何出现的见解,并为资源匮乏的多语言适应提供了实用的见解。我们的代码可在 https://github.com/aditi184/moe-routing-adaptation 获取。