论文

绑定循环——专家混合语言模型中的绑定专家层

Tying the Loop -- Tied Expert Layers in Mixture-of-Experts Language Models

摘要

专家混合 (MoE) 架构通过每个词元仅激活一小部分专家来有效扩展 大语言模型 (LLM),但完整的参数计数(由专家参数主导)必须保存在训练和推理内存中。为了解决这个问题,我们引入了 Expert Tying,这是一种架构修改,可以在连续的 Transformer 层之间共享专家参数,同时保留独立的分层路由和注意力。我们在常见的、最先进的架构(包括 OLMoE、Qwen3 和 DeepSeek 式 MoE)中评估了这种方法。我们的预训练实验表明,捆绑专家可以将内存占用量减少近 2 倍,而困惑度或下游质量几乎没有下降。通过利用 MoE 路径中固有的参数冗余,我们的方法提供了非常有利的计算到内存的权衡,推进了下一代 LLM 的高效训练和扩展。