论文

专家的反击:在专家级别解释专家混合语言模型

The Expert Strikes Back: Interpreting Mixture-of-Experts Language Models at Expert Level

模型评测模型行为与机制分析

摘要

专家混合 (MoE) 架构已成为扩展 大语言模型 (LLM) 的主要选择,每个词元仅激活一部分参数。虽然 MoE 架构主要是为了计算效率而采用的,但它们的稀疏性是否使它们本质上比密集前馈网络 (FFN) 更容易解释仍然是一个悬而未决的问题。我们使用 $k$ 稀疏探测来比较 MoE 专家和密集 FFN,发现专家神经元的多语义性始终较低,随着路由变得稀疏,差距会扩大。这表明稀疏性迫使单个神经元和整个专家走向单一语义。利用这一发现,我们将神经元缩小到专家级别,作为更有效的分析单位。我们通过自动解释数百名专家来验证这种方法。这种分析使我们能够解决关于专业化的争论:专家既不是广泛领域的专家(例如生物学),也不是简单的 词元级 处理器。相反,它们充当细粒度任务专家,专门从事语言操作或语义任务(例如 $\LaTeX{}$ 中的右括号)。我们的研究结果表明,MoE 本质上可以在专家层面进行解释,为大规模模型的可解释性提供了一条更清晰的路径。代码位于:https://github.com/jerryy33/MoE_analysis。