论文

MoE专家专业化的迷思:为什么路由反映的是几何结构,而不必然是领域专长

The Myth of Expert Specialization in MoEs: Why Routing Reflects Geometry, Not Necessarily Domain Expertise

模型评测模型架构MoE模型行为与机制分析

摘要

专家混合模型(Mixture of Experts, MoEs)如今在大语言模型中无处不在,但其“专家专业化”背后的机制仍知之甚少。我们证明,由于MoE路由器是线性映射,隐状态相似性对于解释专家使用相似性既是必要的也是充分的,因此专业化是表示空间的涌现属性,而非路由架构本身的属性。我们在五个预训练模型上、于token与序列两个层面证实了这一点。我们还证明,负载均衡损失会抑制共享的隐状态方向以维持路由多样性,这或许能为数据多样性较低(例如小批次)时出现的专业化坍缩提供理论解释。尽管有这一清晰的机制性解释,我们发现预训练MoE中的专业化模式抗拒人类解读:不同模型回答同一问题时的专家重叠度并不高于完全不同问题之间的重叠度(约60%);提示层面的路由无法预测rollout层面的路由;且更深的层在语义无关的输入上表现出几乎相同的专家激活,在推理模型中尤为明显。我们的结论是:尽管MoE的效率视角已被充分理解,但理解专家专业化的难度不亚于理解LLM隐状态几何——后者是文献中一个长期悬而未决的开放问题。

MoE专家专业化的迷思:为什么路由反映的是几何结构,而不必然是领域专长:论文配图
图 1:命题 1 的实证验证。在 5 个模型的中间层,使用来自 OpenWebText 的 16 个序列,我们比较了所有令牌对隐藏状态的 RMS 距离(方程(5))与他们的路由器登录。左下角:在所有模型中,相似的隐藏状态会导致相似的路由器逻辑,即相似的专家使用情况。中右:当隐藏状态不同时,路由器logits可以相似或不同。离群点是距离第一个令牌大规模激活的距离,即注意力沉降(Sun et al., 2024)。