论文

UMoE:解锁特定领域训练中的每位专家

UMoE:Unlocking Every Expert in Domain-Specific Training

摘要

专家混合 (MoE) 模型可在不成比例计算成本的情况下扩展容量,并已成为前沿 大语言模型 (LLM) 的关键架构。然而,特定领域的 后训练 继承了由混合域 预训练 形成的专家库:专家的大量子集对目标域贡献很少,而标准监督的 微调 (SFT) 使该池的组成保持不变。我们提出了一个简单的、节省预算的管道,可以在 微调 之前将专家库重新调整到目标领域。给定一个目标域,我们(1)修剪具有最低域对齐显着性的专家,(2)通过基于扰动的专家扩展将专家库重新增长到其原始大小,以及(3)应用标准 SFT。生成的模型保留了原始专家计数、参数计数和推理成本。凭借单一的冻结配方且无需针对每个域进行超参数调整,UMoE 在两个 MoE 架构(Qwen3-30B-A3B 和 Qwen3.5-35B-A3B)、五个域(数学、代码、科学、工具使用和代理编码)和 12 个基准测试中持续改进了直接 sft。代表性的改进是数学平均准确度提高了 3.4 分,在 SWE-bench Verified 上提高了 6.0 分。在强大的内部数学语料库上,直接 SFT 已经超过了 Qwen3-30B-A3B-Thinking(82.81 vs.\ 81.06),但 UMoE 将平均值进一步提高到 84.17,额外提高了 1.36 分,这证明了对更强的 SFT 制度的鲁棒性。数据扩展实验进一步表明,随着训练数据的增长,增益会持续存在。分析表明,直接 SFT 模型将大量路由专家计算分配给低显着性子集,该子集可以事后删除,平均降级很小; UMoE 将这种冗余容量转化为有用的领域容量,并实现较低的训练损失,并在下游评估中的所有难度级别上获得收益。