论文

超越上一层:稀疏 MoE 路由中的残差预测结构

Beyond the Previous Layer: Residual Predictive Structure in Sparse MoE Routing

模型评测模型架构MoE模型行为与机制分析

摘要

稀疏专家混合模型通过一系列专家选择来路由每个词元。我们询问前面的选择是否充分总结了该轨迹以预测下一个路由器。使用冻结的 OLMoE 和 JetMoE 模型,我们测量早期专家选择的保留预测收益,同时保留最新的选择作为共同基线。在 OLMoE 中,将历史记录从一层扩展到十一层会将 router-logit $R^2$ 从 0.59879 提高到 0.66544。预先注册的 JetMoE 复制在两个目标深度处产生四层增益 0.14275 和 0.20528,配对的引导间隔高于零。这些增益在非线性解码中仍然存在:向小型多层感知器添加历史记录将 $R^2$ 提高了 0.17137 和 0.21861,而仅对最近状态进行非线性解码比线性探针增加了 0.00139 和 0.00936。参数匹配控制保留了优势,交叉拟合的历史残差以 $R^2$ 为 0.20549 和 0.23556 来预测目标残差。这些发现确定了超出相邻层持久性的专家选择轨迹中的剩余预测结构。