论文
将专家混合修剪和提炼成密集语言模型
Pruning and Distilling Mixture-of-Experts into Dense Language Models
摘要
专家混合(MoE)现在是前沿语言模型的主导架构,但它需要将所有专家参数加载到内存中,这使得它不太适合内存受限的部署。现有的压缩方法减少了专家的数量,但输出仍然是具有相同基本限制的 MoE 模型。我们提出了第一个系统框架,用于将训练有素的 MoE 转换为标准的全密集架构:对专家进行评分、选择和分组,然后连接成密集 FFN,并由 MoE 教师的 知识蒸馏 进行细化。我们在 Qwen3-30B-A3B 上评估了一系列选定的专家计数的 7 种评分方法、5 种分组方法和 2 种量级缩放方法,产生了 350 种配置。我们发现评分方法的选择是最有影响力的,我们新颖的多样性感知评分在 Qwen3-30B-A3B、DeepSeek-V2-Lite 和 GPT-OSS-20B 上始终优于先前的方法。在匹配参数计数的受控比较下,在约 4B 词元 蒸馏 后,MoE 到密集的平均下游精度比密集到密集剪枝的性能高出 +6.3 pp,训练挂钟速度快 1.6 倍。