论文
注意力即路由图:从单次前向传播中在线提取电路
Attention as a Routing Graph: Live Circuit Extraction from a Single Forward Pass
摘要
在语言模型中寻找电路通常意味着运行大量精细的干预。我们尝试更简单的做法:把注意力视为一次前向传播给出的路由图,保留一小组指向答案的路由,并检验这些路由是否真的重要。它们往往确实重要。在归纳(induction)与 IOI(其正确电路已知的任务)上,消融我们提取的边对模型的伤害远大于消融同等规模的随机边集。我们在 GPT-2 Small、GPT-2 Medium 与 Pythia-410M 上评估,每格 n=100 个提示,采用配对差距检验与 bootstrap 置信区间。提取步骤只需一次前向传播,而逐头修补扫描的成本约高两个数量级。我们并不声称给出完整的电路图谱,而是给出一种在已知任务上携带真实因果信号的廉价草图,并明确其失效场景。代码与评估产物见原文链接。
