论文

函数重于形式:具有复制专家机制的专家混合中的分布正交化

Function Over Form: Distributional Orthogonalization in Mixture-of-Experts with Replica Expert Mechanism

摘要

LLM 的扩展越来越依赖 MoE 架构来将主动计算与总参数计数分离。然而,MoE 的功效常常受到专家崩溃和表示冗余的限制,这两者都会导致模型容量的利用不足。为了应对这些挑战,本文提出了分布式正交化损失(DO-loss),这是一种辅助正则化,将焦点从静态权重多样性转移到动态路由行为。通过将每个专家的词元分配历史表示为高维二进制负载签名,DO-loss 会惩罚签名重叠​​,以防止专家崩溃,同时鼓励功能专业化。为了使算法设计与系统效率保持一致,我们进一步引入了副本专家机制(REM),它通过两层策略改进负载平衡:在全局批次级别调整副本专家放置并在微批次级别执行实时词元调度。实证评估表明,我们的方法在 4.8BA0.5B 和 30BA3B MoE 模型的下游任务上优于评估的路由算法,同时保持了相当的训练效率。