论文
全球视角是否有助于优雅地修剪稀疏的 MoE?
Does a Global Perspective Help Prune Sparse MoEs Elegantly?
摘要
语言模型的经验缩放定律鼓励了更大的 LLM 的开发,尽管它们的计算和内存成本不断增长。稀疏专家混合 (MoE) 提供了一种有前景的替代方案,每次前向传递仅激活一部分专家,从而在不牺牲性能的情况下提高效率。然而,大量的专家参数仍然会导致大量的内存消耗。现有的修剪方法通常跨层统一分配预算,忽略了稀疏 MoE 中出现的异构冗余。我们提出了GRAPE(Global Redundancy-Aware Pruning of Experts),一种基于跨层冗余动态分配剪枝预算的全局剪枝策略。在Mixtral-8x7B、Mixtral-8x22B、DeepSeek-MoE、Qwen-MoE和GPT-OSS上的实验表明,在相同的剪枝预算下,GRAPE始终取得最好的平均性能。在论文报告的三个主要模型上,它提高了在剪枝设置中,与最强局部基线相比,平均准确度平均提高了 1.40%,增益高达 2.45%。