论文

从观察到干预:专家混合模型中专家重要性的因果审计

From Observation to Intervention: A Causal Audit of Expert Importance in Mixture-of-Experts Models

模型评测模型行为与机制分析

摘要

可解释性方法通常使用针对观察到的模型行为的人口水平汇总统计数据来许可有关有针对性的干预措施对特定计算的影响的主张;用 Pearl 的话说,他们将第一级关联证据视为支持第二级干预结论,这一举措的有效性很少受到检验。我们研究一个具体实例:在专家混合 (MoE) 修剪中使用路由统计,其中利用率、激活范数和路由权重分布被视为可以在没有功能成本的情况下删除专家的预测因子。对三种高冗余 MoE 架构(OLMoE-1B-7B-0924、Qwen1.5-MoE-A2.7B、DeepSeek-V2-Lite)进行的 词元级 干预审计发现,没有观察指标可以预测任何模型中的因果专家重要性:在所有 60 个指标层组合中,效应大小始终低于 Cohen 的 $d = 0.23$,并且没有指标可以预测因果专家的重要性。根据我们修正的双重测试标准,可靠地呈阳性。每个词元路由权重控制,以相同的 $n$ 运行,排除功率不足,恢复 CI 在 OLMoE 最终 MoE 层排除零的信号 ($d = +0.231$, 95\% CI $[+0.09, +0.37]$, $p = 0.0013$)。现有的修剪方法在这种情况下取​​得成功,不是通过识别可有可无的专家,而是因为早期层冗余使得大多数选择标准可以互换。我们的结果为从人群水平观察摘要到关于专家重要性的 词元级 干预性主张的常见推理步骤提供了明确的反例,并说明了干预性审计如何校准可解释性主张的证据标准。