论文

混合专家中的殊途同归:路由拓扑并不能决定语言建模质量

Equifinality in Mixture of Experts: Routing Topology Does Not Determine Language Modeling Quality

模型评测模型架构MoE模型行为与机制分析

摘要

稀疏混合专家(MoE)架构采用了日益复杂的路由机制——可学习路由器、多跳轨迹、依赖词元的门控。我们要问:路由拓扑真的决定语言建模质量吗?我们构建了一个几何MoE(ST-MoE),在低维空间($d_{space} = 64$)中针对可学习质心进行余弦相似度路由,所需路由参数比标准线性路由器少80%。通过在WikiText-103上以76–84M参数训练至收敛(50K步、1.64B词元)的62个受控实验,我们发现路由拓扑并不能决定渐近困惑度(PPL):五个余弦路由变体在1-PPL范围内统计等价(双单侧检验[TOST],全部10组两两比较均$p < 0.05$;3个随机种子共15次运行,观测范围33.93–34.72)。该结论还扩展到哈希、固定随机和top-1路由(单种子;仅出现1.1–2.2 PPL的温和退化),并在OpenWebText上得到复现(0.03 PPL差距,6次运行,每种3个种子)。路由参数多5.3$\times$的标准线性路由器达到PPL 32.76,但等参数量的余弦路由可弥合该差距的67%——机制本身的真实优势约为$\sim$1.2%。其机理在于收敛冗余:多跳更新彼此共线($\cos(Δh_0, Δh_1) = 0.805$),实现的是幅度放大而非组合推理;单个可学习标量即可复现多跳性能。作为实用收益,零样本相对范数中止可在PPL仅增0.12%的情况下节省25%的MoE FLOPs。专家级的专门化与因果可控性——它们与拓扑级的殊途同归性共存——将在姊妹论文中探讨。