论文
ConMoE:通过原型重指派实现专家池合并的MoE压缩
ConMoE: Expert-Pool Consolidation via Prototype Reassignment for MoE Compression
摘要
混合专家(Mixture-of-Experts,MoE)语言模型降低了每token计算量,但仍需存储并服务全部专家,使部署十分耗费内存。现有的训练后压缩方法主要通过剪枝专家或合并其权重来缩减这一成本。我们将训练后MoE压缩表述为专家池合并(expert-pool consolidation):保留一小组预训练专家作为可复用原型,并将每个原始专家引用确定性地重映射到某个被选中的原型。这一视角将缩减后的专家池与表示原始专家槽位的复用结构分离开来,允许在局部层范围内共享原型,同时保留原始路由器接口。我们提出ConMoE,一个免训练的原型重映射框架:利用基于校准的贡献度与可替换性信号选择保留专家,然后将原始专家调用重定向到所选原型,无需权重更新或压缩后微调。在三个预训练MoE语言模型上的实验表明,ConMoE在多种设定下匹配或超越强剪枝与合并基线,在deepseek-moe-16b-base上于25%与50%路由专家缩减两种比例下均取得最佳平均分,同时在Qwen3-30B-A3B与OLMoE-1B-7B-0125上保持竞争力。消融实验表明,确定性重指派是最稳定的组件,而更大范围的跨层共享与事后权重融合则依模型而定。
