论文
OMP-MoE:以正交匹配追踪压缩MoE专家
OMP-MoE: Efficient Expert Pruning for Mixture-of-Experts LLMs via Orthogonal Matching Pursuit
摘要
混合专家(MoE)模型支持大语言模型的高效扩展,但巨大的内存需求带来关键部署挑战。现有剪枝方法要么搜索成本过高,要么忽略专家之间的动态相互依赖。我们提出OMP-MoE,一个无需训练的压缩框架,用于减少MoE LLM中的专家冗余。依据专家贡献模式的观察,我们将剪枝重新表述为稀疏信号重建,并以正交匹配追踪求解。首先,把各专家贡献视为字典原子,以线性计算复杂度贪心选择使重建误差最小的专家;其次,通过同时考虑重建质量和路由稳定性的注水策略优化跨层专家分配;最后,引入基于能量预测动态调整专家激活的自适应推理机制OMP-MoE。在Qwen、DeepSeek-V2、GPT-OSS和Mixtral MoE上的综合实验中,25%至50%剪枝比例均相对于现有方法获得持续改善。Qwen3-30B-A3B在50%压缩下保留原表现的93.3%,搜索快33倍,推理快1.55倍。代码将在论文接收后公开。