论文

Router Prior Bias:在MoE后训练中保留基础路由结构

Router Prior Bias: Preserving Base Routing Structure in MoE Post-Training

模型训练模型架构MoE监督微调与指令调优

摘要

专家混合 (MoE) 预训练依赖于辅助负载平衡损失 (LBL) 来推动每个专家的利用率趋于均匀。训练后继承了不同的情况:基础路由器已经编码了非均匀专家共激活结构,重新施加的均匀性目标将其压平。我们证明,下游性能取决于软性地保持这种继承的路由,这是我们称之为软路由器锚定的原则,并将其实例化为路由器先验偏差(RPB),这是一种训练时偏差,它将路由器日志拉向冻结基础路由器的先前读数,同时使路由器本身可训练。在 Moonlight-16B-A3B 的数学后训练中,RPB 获得了 45.77 的域内准确率,而在重新应用 LBL 下为 31.91,在非锚定微调下为 29.44,并且比两者都保留了更多的域外能力。针对 LBL 的排序在第二个模型系列 (Qwen3-30B-A3B-Base) 上重现,并且相对于 LBL 的优势可以在独立来源的语料库上解决。在路由器权重、其logits或其输出分布上定义的锚点在没有一致排序的情况下执行类似的操作,这将效果置于约束的软度中,而不是置于特定的先前 RPB 供给中。专家共同激活图中保留的社区结构会在基础路由器不够均匀而无法形成社区的情况下跟踪这些增益,但强制执行与硬分配相同的先验会保留该结构,同时性能急剧下降。因此,社区结构是软锚定的足迹,而不是其来源,实际的教训是,在训练后应该温和地保留继承的路由,因为将其扁平化以实现统一并强制执行它绝对会带来下游成本。我们的代码将在此 https URL 发布。