论文

注意力即路由图:从单次前向传播中在线提取电路

Attention as a Routing Graph: Live Circuit Extraction from a Single Forward Pass

模型评测模型行为与机制分析

摘要

在语言模型中寻找电路通常意味着运行大量精细的干预。我们尝试更简单的做法:把注意力视为一次前向传播给出的路由图,保留一小组指向答案的路由,并检验这些路由是否真的重要。它们往往确实重要。在归纳(induction)与 IOI(其正确电路已知的任务)上,消融我们提取的边对模型的伤害远大于消融同等规模的随机边集。我们在 GPT-2 Small、GPT-2 Medium 与 Pythia-410M 上评估,每格 n=100 个提示,采用配对差距检验与 bootstrap 置信区间。提取步骤只需一次前向传播,而逐头修补扫描的成本约高两个数量级。我们并不声称给出完整的电路图谱,而是给出一种在已知任务上携带真实因果信号的廉价草图,并明确其失效场景。代码与评估产物见原文链接。

注意力即路由图:从单次前向传播中在线提取电路:论文配图
图 1:四步思路:运行一次模型,将注意力解读为路由图,从答案出发反向回溯以保留一个小的边集 S,再将 S 与同等规模的随机边进行对比检验。