论文
超越路由:在稀疏专家混合中解耦专家调度和聚合
Beyond Routing: Decoupling Expert Dispatch and Aggregation in Sparse Mixture-of-Experts
摘要
稀疏专家混合 (MoE) 路由器通常使用相同的分数来选择专家并对其已计算的输出进行加权。我们研究调度和聚合这两个角色是否应该耦合。在预训练的 OLMoE-1B-7B 上,我们保持选定的 Top-8 专家 ID、专家计算和选定的总路由器质量固定,并且仅更改集合内的聚合。结构化预言机将三个种子的全视野交叉熵提高了 0.0160 +/- 0.0039;路由器得分最高的专家仅在 17.2% 的时间内成为反事实最佳顶点,路由器实用性 Spearman 为 0.030。因此,我们训练固定调度自适应聚合(FDAA),这是一个直接使用语言建模目标优化的 301K 参数后计算头,同时冻结主干网、路由器和专家。在 OLMoE 上,FDAA 在三个种子中通过 Delta CE = -0.1523 +/- 0.0031 改进了新的 WikiText-103 测试,并且混合域训练在 WikiText-103、C4 和在冻结验证性评估下保留的 Penn Treebank 上提供了强劲的收益。我们还在 DeepSeek-V2-Lite 上复制了固定调度审计,它使用 Top-6 路由专家加上共享专家。最佳顶点余量在 WikiText 和 C4 上仍然很重要,而路由器 Top1 仅在 12.5% 和 16.7% 的审计示例中识别出最佳选择的专家。在一种子混合域复制中,FDAA 改进了锁定的 WikiText 和 PTB,而 C4 在统计上是中立的。这些结果支持专家选择和专家承诺之间的跨架构区别。