论文
路由何时变得可解释?块注意力残差的因果探索
When Does Routing Become Interpretable? Causal Probes on Block Attention Residuals
摘要
块注意力残差(Block AttnRes)通过在早期深度源表示上用学习的 softmax 替换固定的加性残差,将跨层路由作为前向传递中的可检查张量。这是一个诱人的可解释性目标:通常间接推断的信息流现在可以直接观察到。我们询问这样的暴露是否足以进行机械解释。我们在相同的路由消融干预下探测了两个相同规模($0.6$B)的 Block AttnRes 检查点:一个普通的 Qwen3 推理,通过代码库承认作为路由等效加载路径的确定性新近偏差时间表进行包装,以及一个从头开始训练的 Block AttnRes Qwen3,其中路由作为优化的一部分。包装基线的路由权重与内容无关,并重现调度的分析预测。经过训练的 AttnRes 检查点反而展示了三个本地化路由主题:通过早期层 MLP 的嵌入源路径、通过早期层注意力和 MLP 的当前状态路径以及通过后期层注意力的旧历史路径。除了这种分层之外,我们发现平均路由质量和因果重要性之间存在明显的分离:在两个子层中,最大的质量切片并不是最大的因果贡献,并且一个源族具有可观的质量,并且在干预下没有可检测到的因果作用。因此,路由的架构暴露是必要的,但对于机械解释来说还不够:只有当路由成为训练的一部分时,结构化深度路由才会出现,即使如此,描述性路由摘要也应被视为要通过因果干预进行测试的候选假设,而不是本身作为机制的证据。