论文

平滑稀疏专家组合的 Top-k 暴露边界

Smoothing the Top-k Exposure Boundary for Sparse Mixture-of-Experts

摘要

稀疏专家混合模型可以有效地扩展参数容量,同时保持每个token的固定计算预算。然而,传统的训练范例强制静态选择 top-$k$ 专家,这将连续的路由分布转换为严格的阶跃函数。这种约束引入了一个脆弱的边界,在该边界中,竞争激烈的专家根据较小的分数波动被任意分为完全监督和零反馈区域。为了解决这个问题,我们提出了弹性专家路由,它从以 $k$ 为中心的局部离散分布中随机采样活跃专家预算。经过多次训练迭代,该机制将尖锐阈值软化为渐进的概率分布。由于采样邻域保持对称,因此该方法符合确定性训练的预期计算成本,同时保留推理预算。大量的实验证明了我们的方法在监督微调和从头开始预训练设置方面的有效性。在监督微调期间,弹性 路由将 OLMoE-1B-7B 和 Qwen3-30B-A3B 上的下游宏观平均值分别提高了 $+0.84$ 和 $+2.02$ 点。此外,在从头开始的预训练中,它在下游任务中平均比静态 top-$k$ 基线高出 1.6$ 点。