论文

RouterInterp:了解专家路由混合中的叠加专业化

RouterInterp: Understanding Superposed Specialisation in Mixture of Experts Routing

模型评测模型架构MoE模型行为与机制分析

摘要

稀疏专家混合 (MoE) 模型通过将token路由到仅在处理一小部分token时活跃的模块化专家网络,比密集模型更有效地扩展。关于 MoE 模型性能的一个主要假设是,每个专家都专注于一个单一的、一致的领域。然而,假设这一假设的可解释性努力通常不成功。我们提出并提供了另一种解释的证据,我们称之为叠加专业化假设(SSH):专家专注于细粒度特征的不相交联合,而不是一个广泛的领域。利用 SSH,我们引入了 RouterInterp,这是一种解释专家路由的方法,可识别稀疏自动编码器最能预测路由决策的功能,并生成统一的自然语言解释。在 gpt-oss-20b 上,RouterInterp 解释了专家路由,其检测精度比之前基于token统计的方法高出 ${\sim}65\%$。这项工作提供了一种可扩展的方法,可以生成更准确的专家路由解释,并增加我们的理解 基础模型中以前无法解释的组成部分。