论文

面向LLM可解释性的补丁效应图核

Patch-Effect Graph Kernels for LLM Interpretability

模型评测模型行为与机制分析

摘要

机械可解释性旨在通过激活修补识别因果电路来对Transformer计算进行逆向工程。然而,在不同的提示和任务系列中扩展这些干预措施会产生高维、非结构化的数据集,很难进行系统比较。我们提出了一个框架,通过将激活补丁配置文件表示为模型组件上的补丁效果图,将机械分析重新构建为图机器学习问题。我们介绍了三种图构建方法:通过因果中介的直接影响、偏相关和共同影响,并应用图核来分析结果结构。使用间接对象识别(IOI)和相关任务在 GPT-2 Small 上评估这种方法,我们发现补丁效果图保留了有区别的结构信号。具体来说,局部边缘槽特征比全局图形状描述符提供更高的分类精度。筛选的配对修补验证表明,CI 和 PC 选择的候选边缘对应于比随机或低秩候选边缘更强的激活影响效应。至关重要的是,通过根据严格的仅提示和原始补丁效果控制来评估这些表示,我们使基准的证据范围变得明确:图形特征压缩结构化补丁信号,而原始张量和表面线索定义了任何电路级声明都应该解决的强大基线。最终,我们的框架提供了一个压缩和评估管道,用于在受控基线下比较修补衍生的结构,将稳健的切片区分证据与更强的任务通用因果电路声明分开。

面向LLM可解释性的补丁效应图核:论文配图
(a) name_swap(b) abba(c) 第二主题图 2:GPT-2 小残差流节点的平均补丁效应热图(每片 N=8N=8 个选定示例)。颜色以 logit 单位编码平均斑块效应(红色:正;蓝色:负)。添加的 secondary_subject_swap 面板显示了稍后在分类基准中使用的表面平衡 IOI 控制。