论文

MASKerade:用掩码专家将稠密模型升级为 MoE

MASKerade: Token-Routed Mask Experts for Dense-to-MoE Upcycling

摘要

稀疏激活的混合专家 (MoE) 模型可增加模型容量,而不会按比例增加每个 token 的计算量。密集到 MoE 的升级循环利用预先训练的密集模型来构建此类系统,通常是将前馈网络 (FFN) 复制到独立训练的专家中。我们引入了 MASKerade,一种密集到 MoE 训练方法,它将专家学习为冻结预训练 FFN 的稀疏子网络。每个专家都由学习的二进制掩码定义,并且 token 级路由器选择要执行和组合的掩码 FFN。路由器和掩码分数联合优化,而底层 FFN 权重值保持不变。该公式支持同一路由架构内的神经元结构化、半结构化和非结构化专家。我们的主要配置使用四个具有 top-2 路由的 2:4 专家,其中两个半密集专家通道具有一个密集通道的标称 FFN 算法,而不需要独立的专家权重矩阵。在 Qwen 和 Gemma 骨干模型 的五个视觉语言基准测试中,此配置在比较基准中实现了最高性能。掩码粒度、路由干预和计算匹配控制之间的比较可以区分学习连接性和专家激活计数的影响。这些结果表明,基于冷冻权重的掩模学习是构建 token 路由 MoE 专家的实用替代方案。

MASKerade:用掩码专家将稠密模型升级为 MoE:论文原图
图 2:Qwen3-1.7B 上 2:4 掩模的初始化损失。