论文

超越几何互补性:稀疏专家混合路由中的一致重叠

Beyond Geometric Complementarity: Coherent Overlap in Sparse Mixture-of-Experts Routing

模型评测模型行为与机制分析

摘要

稀疏专家混合 (MoE) 语言模型将每个标记路由给多个专家,建议对其收益进行几何说明:共同选择的专家应该贡献不同的表示方向。现有证据经常将路线一致性、候选质量和候选与上下文的交互混为一谈。我们使用专家子空间分离指数(ESSI)、匹配路径残差和前缀控制的 $2\times2$ 阶乘来区分这些量;冻结途径干预措施和一项对照 Top-$k$ 研究评估功能价值。三对对比组织了这些发现。首先,在六个 MoE 架构中,专家子空间大量重叠,但实际路线比匹配的替代方案更好地解释了词元表示。其次,在 OLMoE、Mixtral 和 DeepSeek 中的 39 个阶乘单元中,所选候选单元比每个单元中最强的未选择竞争对手解释了更多的残差表示,但实际前缀始终缩小了这种优势:所有交互作用都是负的,并且每个 95% 置信区间都低于零。第三,这种几何缩小并不意味着功能冗余:添加后来的专家在 39 个冻结路线比较中的 24 个中改进了下一个词元预测,而其他 15 个估计是不确定的;一项受控训练研究也显示,在所有三颗种子中,前 2 名胜过前 1 名。我们将这种联合模式称为相干重叠:路由从共享几何邻域中选择与词元相关的专家,而有用的多专家计算仍然存在,而没有不相交的线性覆盖。将这些量分开可以阐明为什么仅靠几何相似性无法确定冗余或修剪值。