论文
专家混合大语言模型中的交叉熵引导路由
Cross-Entropy Guided Routing in Mixture-of-Experts Large Language Models
摘要
稀疏专家混合 (MoE) 大语言模型通过将每个标记路由到一小部分专家来扩展模型容量。他们的路由器使用负载平衡项进行正则化,并通过语言模型目标学习亲和力分数。然而,这些目标并没有提供路由亲和性和词元级错误之间的直接一致性。我们以两种形式引入稀疏路由的词元错误监督。第一种形式预测每个专家的错误分数。这些分数的亲和力加权聚合与下一个词元交叉熵损失对齐,而各个分数在 top-$K$ 选择之前减弱了亲和力。第二个直接将路由器的亲和力与模型的目标对齐,而不需要额外的头或推理时间修改。两种公式都使用 Itakura-Saito 散度或指数负对数似然来对齐亲和力和标记错误。通过两个稀疏的 MoE 主干和四个多项选择问答基准,我们评估了两种监督机制。在 Granite 上,我们的方法比参数匹配的路由基线平均提高了大约 2.3 个百分点的准确性。随着监管力度的加大,ARC-Challenge 的收益达到了 2.94 分。两种机制都保留了本机稀疏执行预算和聚合策略。我们的代码可在补充材料中找到。