论文

稀疏 MoE 语言模型中事实回忆的专家感知因果追踪

Expert-Aware Causal Tracing of Factual Recall in Sparse MoE Language Models

模型评测模型行为与机制分析

摘要

激活补丁可以识别专家混合 (MoE) 块,其干净的输出可以恢复损坏的事实预测。然而,由于块输出结合了多个路由专家的贡献,因此块级救援无法确定恢复是局限于单个专家还是取决于路由专家集。我们通过破坏主题标记嵌入、恢复干净的块输出,然后在固定路由下恢复干净的减噪声专家更新,在单标记反事实对比上研究这个问题。在 Qwen3-30B-A3B-Base 中,发现扫描选择第 44 层,保留分析将 L44E069 识别为经常性路由贡献者,与同层活跃专家相比具有积极的特异性。其效果是事实匹配的,并提高了真实词元概率和排名,这解释了层救援的部分原因。在Mixtral-8x7B-v0.1中,选择的循环单例不是特定的;相反,匹配大小的控件显示了干净路由的前 2 组的特殊性。这些发现表明,成功的 MoE 块恢复并不一定意味着局限于单个专家。