论文
SlimQwen:探索大型 MoE 模型 预训练 中的剪枝和 蒸馏
SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training
摘要
结构化剪枝和 知识蒸馏 (KD) 是压缩 大语言模型 的典型技术,但目前尚不清楚如何将它们应用于预训练规模,特别是最近的专家混合 (MoE) 模型。在这项工作中,我们系统地研究了大规模预训练中的 MoE 压缩,重点关注三个关键问题:修剪是否比从头开始训练提供更好的初始化,专家压缩选择如何影响持续训练后的最终模型,以及哪种训练策略最有效。我们有以下发现:首先,在深度、宽度和专家压缩方面,在相同的训练预算下,修剪预训练的 MoE 始终优于从头开始训练目标架构。其次,不同的一次性专家压缩方法在大规模连续预训练后会收敛到相似的最终性能。受此启发,我们引入了一种简单的部分保留专家合并策略,该策略可以提高大多数基准测试的下游性能。第三,将 KD 与语言建模损失相结合优于单独使用 KD,特别是在知识密集型任务上。我们进一步提出多词元预测(MTP)蒸馏,它产生一致的增益。最后,在给定相同的训练标记的情况下,渐进式修剪计划的性能优于一次性压缩,这表明渐进式架构转换会带来更好的优化轨迹。将所有这些放在一起,我们将 Qwen3-Next-80A3B 压缩为 23A2B 模型,保留了竞争性能。这些结果为大规模高效 MoE 压缩提供了实用指导。