论文

SoftMoE:LLM 中专家混合的软可微分路由

SoftMoE: Soft Differentiable Routing for Mixture-of-Experts in LLMs

摘要

稀疏专家混合 (MoE) 架构通过 top-$k$ 路由仅激活一小部分专家,从而能够在固定推理预算下扩展 LLM 参数。虽然这保留了因果关系并适合自回归语言模型,但离散的 top-$k$ 运算符是不可微分的,迫使每个输入有固定数量的活跃​​专家,导致计算使用效率低下。我们提出了 SoftMoE,它用截断的软顶 $k$ LapSum 松弛取代了离散路由,从而允许基于梯度的专家路由优化。我们进一步参数化每层活跃专家的平均数量,并施加全局预算约束,使模型能够学习如何跨层分配专家容量。 SoftMoE 仍然与自回归建模完全兼容,并且在语言建模和下游任务上实现了与稀疏 MoE 相当或更好的性能,同时激活的专家数量明显减少。值得注意的是,学习到的分配非常不均匀,后面的层会激活更多的专家。源代码是公开的$^\dagger$。