论文

几何路由让混合专家实现因果专家控制

Geometric Routing Enables Causal Expert Control in Mixture of Experts

模型评测模型架构MoE模型行为与机制分析

摘要

稀疏混合专家(MoE)模型在固定每词元激活计算量的同时扩展参数规模,但单个专家的专门化仍然不透明。在姊妹论文中,我们已证明路由拓扑对质量是中性的:五种结构不同的配置收敛到统计等价的语言建模质量。本文则表明专家身份仍具有因果意义:单个rank-1专家在构造上即为单语义,而低维度量空间中的余弦相似度路由使其专门化可直接检视。我们给出四条证据线。第一,将专家输出向量投影到unembedding矩阵可得到一部语义词典(Semantic Dictionary):15%的专家是横跨10个类别(时间、地理、基数、语篇、情感、金融、军事、科学)的单语义专家。第二,路由呈现出从词频到句法的梯度:浅层按词频区分词元,深层按句法类别区分(控制Zipf混淆,均$p < 0.001$)。第三,因果干预证实了这些标签:向时间类专家的质心引导使P(temporal)提高+321%(44条提示的中位数);抑制地理类专家使P(geographic)下降-23%;改写专家的输出向量可使目标类别概率减半,且效应跨层可加。第四,这些干预并非余弦路由独有:线性路由器支持相当的引导,但只有余弦路由提供几何透明性——专家专门化可直接从质心矩阵中读出。MoE的专家级专门化是一等的可解释性原语:架构上单语义、经因果验证,并能以零开销在推理时进行控制。