论文

无需训练 细粒度混合专家模型中激活专家减半

Training-Free Halving of Activated Experts in Fine-Grained Mixture-of-Experts Models

模型推理推理加速

摘要

现代细粒度专家混合 (MoE) 模型将每个词元路由给少数专家,并重新规范化它们的路由概率。我们表明,这种重整化隐式地将专家输出增益校准到训练 top-$k$:在推理中减少 $k$ 不仅会改变使用的专家,还会改变专家分支的强度。我们通过激活前 $k_1$ 专家来分离这些影响,同时按前 $k_2$ 专家的概率质量进行归一化,引入一个没有参数、训练或可测量计算开销的整数。在 Qwen3.6-35B-A3B 上,从 8 个专家减少到 4 个专家会导致标准重整化下 MMLU 下降 4.65 点,但在 $k_2=16$ 时仅下降 0.35 点,同时路由专家计算量减半。结果在大 11 倍的 Qwen3.5-397B-A17B 上得到了复制,在适当的参考集下,将专家从 10 名减少到 5 名,仅损失 0.55 分。完全消除重整化是灾难性的,这表明保留合适的参考质量至关重要。我们进一步发现困惑度和下游准确度有利于不同的 $k_2$,警告不要单独使用未标记的文本选择 MoE 压缩设置。分析还表明,专家身份比专家加权更重要,而平衡和领域专用路由为专家修剪留下了有限的空间。