论文
SHAPE:稀疏专家混合的联盟感知专家剪枝 LLM
SHAPE: Coalition-Aware Expert Pruning for Sparse Mixture-of-Experts LLMs
摘要
稀疏专家混合 (MoE) 大语言模型 通过较低的每个词元计算量实现了强大的质量,但它们的部署通常受到内存墙的限制:完整的专家池必须保持驻留以支持词元相关的路由。专家修剪是一种直接的补救措施,但先验标准通常独立地对专家进行评分,并忽略了 MoE 推断本质上是 \emph{coalitional},其中输出来自路由的 top-$k$ 专家组合。我们提出了 \textbf{SHAPE},一个任务驱动的修剪框架,它显式地模拟 \emph{intra-layer} 专家合作。 SHAPE 将小型校准集上的路由跟踪制定为经验合作游戏,并通过对观察到的 top-k$ 联盟的 Shapley 式归因来分配交互感知的专家值,从而能够识别对高效用协作至关重要的专家,而不仅仅是频繁的专家。为了在全局修剪预算下保留 MoE 拓扑,SHAPE 进一步引入了 \emph{quality-coverage} 选择规则,该规则在每一层中保留覆盖非负 Shapley 质量的 $α$ 部分的最小专家子集,同时使用二分法来匹配目标保持率。在三个现代 MoE 主干(Qwen3-30B-A3B、GPT-OSS-20B 和 DeepSeek-V2-Lite)上跨不同基准进行的实验表明,SHAPE 持续提高了全局和逐层剪枝变体的鲁棒性,无需额外训练即可在 20% 和 40% 专家剪枝下保持有竞争力的准确度,并显着减少峰值 GPU 内存占用。开源代码可从 https://github.com/Alizen-1009/Shapley-Moe 获取。