论文

适用于混合专家的置信自适应 SwiGLU

Confidence-Adaptive SwiGLU for Mixture-of-Experts

模型架构Transformer

摘要

SwiGLU 已成为现代 Transformer MLP 中的标准门控激活,但其门控锐度(门控函数的平滑度和选择性)通常在整个训练过程中是固定的。在这项工作中,我们提出了 Confidence-Aware SwiGLU ($κ$-SwiGLU),它是专家混合 (MoE) 模型的 SwiGLU 变体,可根据 词元级 路由置信度调整专家门锐度。具体来说,$κ$-SwiGLU 将 SiLU 门锐度系数参数化为路由器 logits 的可学习函数,使每个专家门单元能够在平滑、广泛活跃的门控和尖锐、选择性门控之间进行插值。我们在 MoE Transformer 模型(从 8 层到 28 层)的 FineWeb-Edu 数据集上评估 $κ$-SwiGLU。在这些设置中,$κ$-SwiGLU 提高了平均 CORE 性能,同时添加了可忽略不计的参数,并且仅产生很小的计算开销,这表明置信感知门锐度是改进 MoE MLP 的一种有前景的机制。该代码可在 https://github.com/askerlee/kappa-swiglu 获取。