论文
从相关性到原因:Transformer 语言模型特征分析的五阶段方法
From Correlation to Cause: A Five-Stage Methodology for Feature Analysis in Transformer Language Models
摘要
我们提出了一种在 Transformer 语言模型中进行因果特征分析的五阶段方法(探针设计、特征提取、因果验证、稳健性测试和部署集成),并在执行间接对象识别 (IOI) 任务的 GPT-2 小型机上进行端到端演示。激活修补可恢复规范的 IOI 电路(第 9 层头 9 单独提供恢复 +1.02)。稀疏自动编码器恢复每个名称的选择性特征,其效果大小为 30 到 50 个激活单元。因果验证可以明确地发现这些特征,但只是部分因果关系:消除其中 15 个特征后,模型可以在 98% 的提示上保持准确。两项受 NLA 启发的评估强化了这一图景:15 个选择性特征仅解释了 31% 的激活方差,而 SAE 的激活方差为 99.7%,并且选择性比与因果力反相关 (r = -0.56)。三个分布变化下的鲁棒性测试发现,电路传输干净,但特征消融效应大幅下降,暴露了检测鲁棒性和因果鲁棒性之间的差距。基于成本的部署评估(假设 50 美元/FN、0.42 美元/FP、2% 错误率)发现最佳监视器配置相对于 1000 美元的基准,每 1000 个查询可产生 8.96 美元的收益,节省了 99.1%。最佳组合策略随成本比和基本费率而变化。各个阶段的结合会产生单个阶段无法产生的发现。