论文

少即是 MoE:削减领域专业语言模型中的专家

Less is MoE: Trimming Experts in Domain-Specialist Language Models

摘要

专家混合 (MoE) 模型通过条件计算实现了强大的性能,但其较大的参数占用量带来了部署挑战。当在超出常识推理的通用基准上进行评估时,先前的 MoE 压缩方法会遭遇灾难性的失败。我们将这种失败追溯到压缩粒度:重要的功能分布在专家之间,但集中在 FFN 稀疏的中间维度中。为了识别这些维度,我们使用 Fisher 重要性,它优于基于激活、路由器得分和幅度的替代方案,并识别任务关键维度的微小集合:在 Qwen1.5-MoE 中,删除 1.35M 路由 FFN 中间维度中的 12 个即可破坏 GSM8K 准确性,同时在很大程度上保留事实知识性能。在此基础上,我们提出了 Fisher-MoE,它在 FFN 内运行,以删除按 Fisher 重要性排名的中间维度。在相同的 50% MoE 压缩比下,Fisher-MoE 保留了模型能力,同时将权重内存减少了约 45%,并将推理吞吐量提高了 21%。这些发现表明,中间维度粒度是压缩和排名的有效单位,其中能力集中在 MoE 模型中。