稀疏概率图如何塑造专家混合路由
How Sparse Probability Maps Shape Mixture-of-Experts Routing
摘要
专家混合 (MoE) 路由器通常将 softmax 应用于路由器分数并保留前 K 个专家,使得每个token恰好使用 K 个专家。稀疏性诱导的概率图(例如sparsemax、alpha-entmax和normmax)可以自适应地将精确的零分配给选定的专家,因此即使在使用相同的top-K机器时,似乎也提供了依赖于token的专家参与。在这项工作中,我们研究了这种稀疏性是否以及如何在训练中幸存下来。我们使用 softmax、1.5-entmax、sparsemax 和 2-normmax 训练匹配的 300M 和 1B top-2 MoE 语言模型,发现训练后映射的行为非常不同:在 1B 时,entmax 丢弃比 softmax 少 30% 的概率质量,同时几乎不会丢弃选定的专家,sparsemax 保留最多质量,normmax 将token的 21% 路由到单个专家。这些结果不仅仅是地图的属性。仅当两个最大分数之间的差距达到固定阈值时,每个映射才会丢弃选定的专家,并且训练有素的路由器在它们学习的分数分布上有所不同:entmax路由器学习的分数大约是softmax传播的一半,这使其top-2差距低于其阈值,而sparsemax和normmax共享相同的阈值,学习不同的差距分布,因此不同的参与。因此,路由器共同调整它们的分数以适应地图,并且地图产生零的能力本身并不决定专家的参与。虽然没有一个稀疏映射比 softmax 改善了验证损失,但它们使得训练后的模型对于在推理时选择更多专家的敏感度要低得多:用 K=2 训练的稀疏映射在用 K=8 运行时损失了 0.02 nat,而 softmax 损失了 0.58。我们的结果表明,自适应 MoE 路由必须围绕概率图和学习分数的联合行为进行设计,而不是单独围绕地图进行设计。