论文

在专家混合调优中保留长尾专家信息

Preserving Long-Tailed Expert Information in Mixture-of-Experts Tuning

摘要

尽管 MoE 模型领先许多基准,但 MoE 架构的监督 微调 (SFT) 仍然很困难,因为其路由器层很脆弱。 DenseMixer 和 ESFT 等方法通过密集混合或辅助负载平衡损失来缓解路由器崩溃,但这些方法会引入噪声梯度,从而通常会降低性能。在初步实验中,我们系统地修剪了专家,并观察到虽然某些超级专家的激活频率要高得多,但丢弃较少使用的专家仍然会导致性能显着下降。这表明,即使很少激活的专家也会编码对下游任务有用的重要知识。受此启发,我们提出了一种辅助无损耗 MoE SFT 框架,它将偏置驱动的稀疏化与始终活跃的门控冷凝器专家相结合。我们的方法不是在所有专家之间强制平衡激活,而是鼓励与任务相关的专家保持活跃,同时将长尾专家推向不活跃状态。冷凝器专家提供了一条持久的、可学习的途径,可以缓解梯度饥饿,并促进信息的整合,否则这些信息在稀疏激活的专家中会保持碎片化。分析进一步表明,该设计在稀疏路由下更好地保留了长尾专家信息。大规模 MoE 模型的实验表明,我们的方法优于最先进的 SFT 基线,例如 DenseMixer 和 ESFT,在数学推理和常识 QA 基准上实现了 2.5% 以上的平均增益。