论文

面向自回归语言建模的专家阈值路由:动态计算分配与负载均衡

Expert Threshold Routing for Autoregressive Language Modeling with Dynamic Computation Allocation and Load Balancing

摘要

Token-choice混合专家模型(TC-MoE)将每个token路由到固定数量的专家,这限制了动态计算分配,并且需要辅助损失来维持负载均衡。我们提出专家阈值(ET)路由:每个专家维护一个从全局token分布估计得到的指数移动平均(EMA)阈值。在训练和推理时,若某个token的分数超过某专家的阈值,该token就被独立地路由到该专家,从而在无需辅助损失的情况下实现动态计算分配并达成负载均衡。这一完全因果的机制消除了对批次中其他token的依赖,因此非常适合自回归语言建模。在FineWeb-Edu上扩展至2.4B参数的预训练实验中,ET取得了比TC-MoE低0.067的交叉熵损失,相当于用少1.6×的token达到相同性能。

面向自回归语言建模的专家阈值路由:动态计算分配与负载均衡:论文配图
图 5:EC (2k) 和 ET 的激活动态。两种方法都将更多计算分配给早期位置,EC (2k) 显示出更急剧的峰值。淡虚线显示每层平均值,红色实线显示全局平均值。当按损失分箱时,EC (2k) 扇出单调上升,而 ET 在下降之前提前达到峰值。