论文
HERO-MoE:复用前层路由分布改善专家选择
HERO-MoE: Historical Expert Routing with Scale-Preserving Fusion
摘要
专家混合 (MoE) 架构已成为扩展模型容量同时保持计算稀疏的标准方法,但路由仍然是 MoE 质量和训练行为的关键决定因素。先前的实证研究表明,MoE 路由反映了输入语义和跨深度的上游计算,但标准路由器没有明确使用前面层生成的路由分布。我们提出了 HERO-MoE(带有规模保留融合的历史专家路由),这是一种路由框架,通过重用从前面的 MoE 层收集的分离的密集路由分布,将历史路由先验注入到 MoE 路由器中。关键思想很简单:HERO-MoE 保留原始的词元条件路由分支,并在标准 softmax 和 top-$k$ 调度之前添加剩余历史路由贡献。为了稳定这一历史信号,HERO-MoE 引入了一种保留尺度的融合机制,该机制将历史路由记忆的大小与当前隐藏表示相匹配,并考虑可见历史层的数量,而无需引入辅助路由损失或特定于融合的调整参数。通过重用前面 MoE 层已经计算出的路由分布,HERO-MoE 以适度的端到端开销改善了训练损失的减少。由此产生的路由器仍然与标准稀疏调度兼容,包括 top-$k$ 和组限制路由,并且可以通过最小的架构更改插入到现有的 MoE 主干中。在具有 0.5B 活动参数的大约 8B 参数 MoE 模型上进行的实验,在 100B 词元上从头开始训练,结果表明 HERO-MoE 将最终损失从 1.6393 减少到 1.6184,而峰值内存和 FLOPs 仅分别增加了 0.44\% 和 0.64\%。