论文

TENP:混合专家的梯形专家神经元修剪

TENP: Trapezoidal Expert Neuron Pruning For Mixture-of-Experts

摘要

专家混合 大语言模型 (LLM) 通过稀疏激活有效扩展,但它们的部署从根本上受到专家的大量静态参数占用的限制。现有的压缩方法要么消除整个专家,破坏路由拓扑并损害性能,要么依赖非结构化权重修剪,实际效率有限。为了解决这些限制,我们提出了 TENP,一种结构化的梯形专家神经元修剪框架。使用少量样本,我们识别并保留重要的专家,同时对不太重要的专家应用专家神经元剪枝(ENP),从浅层到深层以梯形模式保留模型参数。在评估专家重要性时,我们共同考虑专家输出的大小及其改变输入向量方向的能力。对于 ENP,我们测量每个神经元对专家输出的预计贡献,以识别和保留重要的神经元。我们对 Qwen 和 DeepSeek 模型进行了广泛的实验。在路由专家稀疏度为 40%、平均激活专家参数为 63.76% 的情况下,DeepSeek 模型与全参数模型相比,准确率仅下降了 1 个百分点。此外,它在代码生成任务上比全参数模型高出 10%。