论文
面向稀疏MoE语言模型剪枝的通用专家覆盖
Generic Expert Coverage for Pruning SparseMixture-of-Experts Language Models
摘要
稀疏激活的混合专家(MoE)语言模型在被路由专家间包含大量结构化冗余——但在无下游校准数据时剪枝它们仍有挑战。既有专家剪枝方法通常依赖单一聚合重要性分数——这可能使保留集合偏向主导校准模式青睐的专家。我们提出通用TB-Coverage——覆盖感知的专家剪枝方法——仅用通用文本语料(WikiText2与C4)校准。我们的方法不把专家效用坍缩为一个分数——而是在每个语料上分别刻画逐专家效用——并强制固定预算覆盖规则——在构建最终剪枝掩码前保留来自每个语料的高效用专家。跨Qwen1.5-MoE-A2.7B与DeepSeek-MoE-16B-Base在25%、50%与75%保留预算下——我们的方法在六个常见零样本基准上的平均准确率超越随机剪枝、REAP与ExpertSparsity——同时降低WikiText2与C4上的困惑度退化。增益在激进剪枝(25%与50%保留)下最大——表明保持跨语料专家覆盖是MoE剪枝的有效通用数据先验。我们的改进在固定剪枝预算与无下游校准数据下成立。