论文

训练后的 MoE 可以通过自我 蒸馏 跳过一半专家

Post-Trained MoE Can Skip Half Experts via Self-Distillation

摘要

专家混合(MoE)通过稀疏专家激活有效地扩展语言模型,其动态变体通过以依赖于输入的方式调整激活的专家来进一步减少计算。现有的动态 MoE 方法通常依赖于从头开始的 预训练 或特定于任务的适应,从而使经过充分训练的 MoE 的实际转换尚未得到充分探索。启用这种适应将通过允许简单的词元在服务期间绕过不必要的专家来直接降低推理成本。本文介绍了零专家自 蒸馏 适应 (ZEDA),这是一种低成本框架,可将训练后的静态 MoE 模型转换为高效的动态模型。为了稳定这种架构转换,ZEDA 将无参数零输出专家注入每个 MoE 层,并通过两阶段自 蒸馏 来调整增强模型,利用原始 MoE 作为冻结教师并应用组级平衡损失。在 Qwen3-30B-A3B 和 GLM-4.7-Flash 上,跨越数学、代码和指令跟踪的 11 个基准测试,ZEDA 在边际精度损失的情况下消除了超过 50% 的专家 FLOP。它在两个模型上的性能比最强的动态 MoE 基线高出 6.1 和 4.0 点,并提供约 1.20$\times$ 的端到端推理加速。