论文
Transformer 场论:机械可解释性的响应理论方法
Transformer Field Theory: A Response-Theoretic Approach to Mechanistic Interpretability
摘要
机械可解释性通常通过激活修补、因果追踪、路径修补和转向方向干预内部激活来研究 Transformer 行为。本文开发了 Transformer 场理论:一种响应理论框架,其中固定前向传递的残余流被视为层深度和词元位置上的 Transformer 场。在此公式中,修补成为 Transformer 场中的局部源插入,一阶敏感场预测修补效果,格林函数描述下游传播,修补选择被提出为伴随逆问题。根据经验,我们在 GPT-2 式自回归 Transformer 中测试了该理论的前向响应对象。局部 Transformer 场干预表现出有界局部线性状态;一阶敏感性预测跨层词元站点的补丁效应;局域源产生结构化各向异性 Transformer 场传播;高敏感度站点和切片绿色算子提供减少的响应描述;和提示引起的 Transformer 场位移部分转移答案行为。这些结果建立了灵敏度、Transformer 场响应和切片 Green 算子作为组织补丁实验的实际对象,同时为补丁站点推理和跨尺度响应传递提供了正向数学基础。