论文
稠密MoE作为重参数化的宽FFN:固定算力下的粒度扫描
Dense Mixture-of-Experts as a Reparameterized Wide FFN: A Granularity Sweep at Fixed Compute
摘要
稀疏混合专家(MoE)模型结合学习路由与专家池选择。我们用稠密类比分离动态专家组合的贡献:K个SwiGLU专家对所有token激活、以softmax门组合,在固定总FFN宽度下,稠密基线即K=1情形。验证损失随K非单调变化:K=2较基线改善0.0048,而K=4与K=6分别恶化0.0053与0.0197。路由总体保持软性且专家使用均衡,唯独K=4模型的第一层路由近乎one-hot;强制该门为均匀会使诊断子集损失增加2.4 nats,表明其集中路由具有功能重要性。我们进一步证明该架构恰是带token相关、单纯形约束组缩放的稠密SwiGLU,且其函数类包含稠密基线。这些单次运行的结果提示:固定宽度下始终激活、软门控FFN存在粒度甜点,K=2在所测配置中最优。