论文
MoRA:通过路由器偏差学习和专家逼近进行 MoE 修剪
MoRA: MoE Pruning via Router Bias Learning and Expert Approximation
摘要
专家混合 (MoE) 模型通过仅激活每个词元的一小部分专家,以有限的每个词元计算来实现参数扩展,但部署它们仍然需要将完整的专家池加载到内存中。结构化专家剪枝可以通过删除专家来有效减少内存使用。然而,现有的修剪方法要么使用与模型性能不太一致的专家排名标准,要么依赖计算成本高昂的有效专家子集搜索。此外,这些方法通常忽略了保留的专家之间的路由行为冗余。在本文中,我们提出了通过路由器偏差学习和专家近似(MoRA)进行 MoE 剪枝,这是一种结构化 MoE 专家剪枝的框架。我们为每个专家引入了可学习的路由器偏差,并通过最小化语言建模损失和路由多样性正则化器来优化这些偏差。学习到的路由器偏差会锐化路由概率分布,以识别对模型性能至关重要的专家,同时鼓励选择具有不同路由偏好的专家。此外,我们引入了专家近似机制作为后剪枝增强。它利用剩余的专家通过仿射变换来近似剪枝专家的输出,进一步提高剪枝模型的性能。我们在 Qwen3-30B-A3B、DeepSeek-V2-Lite 和 Moonlight-16B-A3B 上评估 MoRA,去除每个 MoE 层中 25% 和 50% 的路由专家。对九个零样本基准的大量实验表明,MoRA 的性能优于最先进的剪枝算法。我们的代码将被发布。