论文
面向自回归语言建模的专家阈值路由:动态计算分配与负载均衡
Expert Threshold Routing for Autoregressive Language Modeling with Dynamic Computation Allocation and Load Balancing
摘要
Token-choice混合专家模型(TC-MoE)将每个token路由到固定数量的专家,这限制了动态计算分配,并且需要辅助损失来维持负载均衡。我们提出专家阈值(ET)路由:每个专家维护一个从全局token分布估计得到的指数移动平均(EMA)阈值。在训练和推理时,若某个token的分数超过某专家的阈值,该token就被独立地路由到该专家,从而在无需辅助损失的情况下实现动态计算分配并达成负载均衡。这一完全因果的机制消除了对批次中其他token的依赖,因此非常适合自回归语言建模。在FineWeb-Edu上扩展至2.4B参数的预训练实验中,ET取得了比TC-MoE低0.067的交叉熵损失,相当于用少1.6×的token达到相同性能。
