论文

Matryoshka 归因:学习将语言模型输出归因于表示和权重

Matryoshka attribution: Learning to attribute language model outputs to representations and weights

模型评测模型行为与机制分析

摘要

将语言模型输出归因于其内部计算是可解释性中的一个开放性问题。现有的方法使用因果干预、梯度或可学习的掩模,要么成本高昂,要么难以识别实际的因果重要的内部计算。我们建议将框架归因视为识别内部组件的嵌套子集的问题,从而最大限度地减少下游损失。为了学习此任务,我们引入了 Matryoshka Attribution (MAttr),这是一种掩码学习方法,它使用简单的可微分 sigmoid top-$k$ 运算符对掩码进行参数化。我们通过在训练中随机化 $k$ 来同时监督所有稀疏性的训练,从而根据归因分数来学习组件的排序。 MAttr 在机械可解释性基准的官方排行榜上排名第一(Mueller 等人,2025);我们的方法识别不同电路基础上的稀疏且任务可转移的电路。作为一个实际应用,我们表明可以通过强化学习来训练 MAttr,以识别负责 LLM 微调中下游行为的权重变化。我们根据拒绝判断分数训练 MAttr,发现将 Llama 3.1 8B Instruct 的权重恢复到其基本模型状态的 $1\%$ 足以消除拒绝,同时保持能力。我们将 MAttr 视为将可解释性成功地表述为可学习目标的方法,我们可以通过梯度下降来解决该目标,并鼓励未来沿着这些思路开展工作。