论文
你只需要 2/3 的选定专家:细粒度 MoE LLM 中动态专家剪枝的实证研究
You Only Need 2/3 of the Chosen Experts: An Empirical Study of Dynamic Expert Pruning in Fine-Grained MoE LLMs
摘要
细粒度专家混合(MoE)架构已成为开放权重大语言模型的主流设计,拥有数百名专家,并且每个词元选择的专家数量越来越多。这种转变使得动态专家剪枝成为一种更便宜的推理的有吸引力的途径。然而,现有的证据主要来自较粗略的架构和可能性评分的多项选择基准,在细粒度的体系中留下了三个核心问题:每个词元的专家选择有多么冗余,现有的剪枝方法如何有效地利用这种冗余,以及什么控制着模型对剪枝的敏感性。我们通过对跨越 9 个架构系列的 12 个细粒度 MoE 检查点进行系统实证研究来填补这一空白,其中包括 11 个基准的核心套件,涵盖知识 QA、数学、代码生成和一般推理。我们发现,专家选择比该领域的操作点假设的冗余程度要高得多:统一保留大约三分之二的所选专家平均保留 98.8% 的未修剪性能,只需要一个整数的更改,并在两个服务后端提供 1.2-1.7 倍的测量加速。这个简单的基线在保守预算下几乎没有留下动态分配的空间:即使是最好的已发布规则,在匹配的专家预算下也与它相差不到 1%。它们的价值在积极的修剪下显现出来,其中最好的规则比均匀截断恢复高达 3.0%,收益集中在遭受最严重退化的生成任务上。对积极修剪的敏感性还取决于模型:较大且具有思考能力的模型更具弹性,而多模态模型则更容易受到攻击。总之,这些发现揭示了细粒度 MoE 可以省去多少专家计算,并确定动态分配何时变得复杂,从而为实际部署和未来的修剪方法提供信息。