论文

光谱探针电路:识别预训练 Transformer 中注意力头电路的三步方法

Spectral Probe-Circuits: A Three-Step Recipe for Identifying Attention-Head Circuits in Pretrained Transformers

模型评测模型行为与机制分析

摘要

我们提出了一个三步方法,用于识别预训练的 Transformer 中的注意头电路。每个头的频谱信号(每个头的注意力输出的时间积分参与比)对头进行排名,进行持续的内容相关计算,无需标签或归因梯度。任务模式屏幕将这个一般指标过滤到特定于任务的候选回路中,并且针对匹配的随机控制进行组消融来完成因果声明。我们验证了 8x 参数范围(51M 到 1B 活跃/7B 总计)、两个架构系列(密集、专家混合)和四个预训练管道。配方端口:2-6 头感应电路在每个测试模型中都是必需的,消融后合成感应 top-1 下降了 94-100%。光谱信号无需监督即可预测:在 51M 参数探针模型的六个独立种子上,相同的计算可识别每个种子上的种子特定电路。在 Pythia 系列(124M 到 410M)中,进行可识别的专门计算的头比例保持在 17-19%,而特定感应电路保持 3-11 个头——总头数呈次线性。本文是三篇论文计划的方法论支柱;配套论文将方法扩展到预训练期间的发展轨迹以及组合任务电路,其中模式选择性与任务因果结构脱钩。