论文
一半专家,全部代码:用于编码的混合专家 LLM 的一次性域修剪
Half the Experts, All the Code: One-Shot Domain Pruning of Mixture-of-Experts LLMs for Coding
摘要
最强大的开放权重编码模型是专家混合(MoE)网络:它们的大部分规模来自大量“专家”子网络,其中只有少数对任何词元起作用。这个池就是为什么这些模型不适合大多数开发人员拥有的机器,但对于只需要编码帮助的用户来说,大多数专家编码永远不会被调用的能力。我们询问可以删除多少专家,并通过在五种选择策略下修剪来自不同系列的两个最新开放权重 MoE 模型(Qwen3.6-35B-A3B 和 Gemma-4-26B-A4B),来判断用户的方式:通过模型是否仍然编写正确的代码。一半的专家可以从任一模型中删除,而在主要代码基准上没有统计上可检测到的损失,并且损失几乎完全落在编码(预期交易)之外的能力上。但制胜策略会在两个模型之间翻转,因此在一个家庭中验证过的配方不能假设在另一个家庭中也有效。我们进一步表明,困惑度(许多修剪文献所依赖的度量标准)可以将损坏的模型评为高于完整模型的等级;轻量级微调可以恢复积极修剪损失的大约一半;并且与将整个模型量化到相同的内存相比,修剪只有在量化必须降至每个权重 3 位以下的情况下才会获胜。五次尝试推翻这种交叉,并预先确定了故障标准(更好的校准、谨慎的选择、因果专家的重要性、故障归因以及让每个模型从执行反馈中修复其故障的代理评估),所有这些都让它保持不变;最后一个显示单次基准测试广泛夸大了压缩损失,因为一次修复完全消除了 2 位量化损失。专家修剪是有效的,但它需要对模型实际服务的任务进行每个模型的验证。