论文

RAZOR:按混合残差裁剪可替代的 MoE 专家

RAZOR: Pruning Replaceable Experts in LLMs

摘要

混合专家(MoE)模型每个 Token 只激活少量专家,但需要存储完整专家池。专家剪枝可以减少存储,在固定剪枝预算下,目标是尽量保持原模型的输出分布。专家的使用频率或贡献幅度本身不足以判断移除损害,关键在于剩余计算能否替代它的功能。我们提出无需训练的专家剪枝方法 Razor,以共识残差衡量功能可替代性,即专家输出偏离原始加权混合输出的程度。在固定层输入下,精确的单专家删除恒等式同时考虑剩余专家权重重新归一化和路由器选择的补位专家,再汇总校准 Token 上的局部分数,在预算内剪枝,无需梯度或恢复训练。在 GLM-4.7-Flash、Qwen3.6-35B-A3B、DeepSeek-V4-Flash-0731 和 Hy3 上,分别移除 25% 和 50% 的专家,Razor 在全部八组设置中取得所比较剪枝方法里最高的九任务宏平均分。在具有匹配 REAP 基准运行的两个模型上,得分比 REAP 高 2.12—5.59 个百分点,并赢得全部 36 项配对任务比较;在 GLM-4.7-Flash 与 Qwen3.6-35B-A3B 的四组匹配模型及预算设置中,反向 KL 也低于 REAP。不过,Qwen3.6-35B-A3B 的生成分析仍显示多样性、格式和终止方式发生变化,说明任务表现与预测保真度得到保持,并不保证生成行为稳定。

不同路由集中度及专家移除比例下的反向KL结果;数值越低越好。
图6(图注摘要):不同路由集中度及专家移除比例下的反向KL结果;数值越低越好。