论文
DivMoE:通过跨域专家组合实现细粒度MoE扩展
DivMoE: Fine-Grained MoE Upcycling via Cross-Domain Expert Composition
摘要
专家混合 (MoE) 架构对于扩展大型语言模型至关重要,最近的工作证明了细粒度专家设计的好处。从头开始训练此类模型的成本很高,而从预训练的密集模型中进行稀疏升级是一种有吸引力的替代方案。然而,我们发现了细粒度升级的结构病态:当细粒度专家从单一源模型派生时,幼稚路由崩溃,下游精度下降到接近随机(例如,在 Qwen3-1.7B 上,Drop-Upcycling-fine-grained 在 15 个基准测试中仅达到 23.2% 的平均精度,基本上与从头开始训练的 22.2% 相匹配,而相同方法的粗粒度变体达到50.2%)。我们提出了 DivMoE,这是第一个通过结构平衡路由实现细粒度 MoE Upcycling 的框架。 DivMoE 引入了领域专用的细粒度专家初始化,从经过领域自适应连续预训练的密集模型中派生出专家,以及多样性约束路由(一种硬结构约束,保证每个专家 token激活来自不同领域组的专家。在两个基础模型和 15 个基准测试中,DivMoE 始终优于 6 个升级基线(Qwen3-1.7B 上最强基线为 55.6% 与 51.6%),并且在第 2 阶段持续预训练后的每个基准上都严格改进了密集基础模型 - 缩小了困扰之前细粒度升级改造的回归差距。在对公共推理混合物进行监督微调后,我们的 12B 参数 DivMoE 模型以 64.5% 的平均准确度与 Moonlight-MoE (16B) 相匹配,同时比受控的 NVIDIA-Upcycling 基线高出 6.1 个百分点。