论文
当负载平衡太过分时:过度分散的专家混合模型中的专家剪枝
When Load-Balancing Goes Too Far: Expert Pruning in Over-Dispersed Mixture-of-Experts Models
摘要
假设路由器概率提供可靠的重要性信号,专家剪枝通过删除路由器识别的低重要性专家来减少专家混合 (MoE) 模型的内存和服务成本。我们观察到,这种假设在过度分散的路由下被打破,这是一种与训练期间积极的负载平衡相关的制度,其中词元几乎均匀地分布在专家之间,并且重要性信号崩溃。在这种情况下,困惑度不能预测下游任务的准确性:在 gpt-oss-20B 上,困惑度最低的修剪配置会产生最差的数学推理,而困惑度最高的配置则保留它。在标准路由(例如 Mixtral-8x7B-Instruct)下不会发生这种情况,其中困惑度和准确性会同时降低。过度分散路由下的修剪还暴露了一种能力权衡,其中没有单一评分指标占主导地位:激活感知评分保留了数学推理,但严重降低了知识密集型科学(GPQA 上的 18 分差距),而基于频率的评分则表现出相反的情况。我们提出了最小最大专家分数分配(MESA),这是一种领域感知方法,可以迭代地提高服务于当前受影响最严重的领域的专家的重要性分数,从而最大限度地减少最坏情况下的领域退化而不是平均准确度。在 25% 的专家剪枝下,MESA 实现了跨域的最小最坏情况退化,在 11 个基准测试中的 7 个上优于激活感知基线,同时内存占用相应减少,并且它推广到 gpt-oss-120B、Gemma-4-26B-A4B 和 OLMoE-1B-7B。我们的结果表明,过度分散的路由是一种本质上不同的修剪机制,其中标准假设失败,并且认识到它是负载平衡 MoE 模型原则性专家修剪的先决条件。