论文
对齐、统一、抑制、路由:Transformer 计算的连贯视图
Align, Unify, Suppress, Route: A Coherentist View of Transformer Computation
摘要
机械可解释性已识别出 Transformer 电路,但缺乏用于描述其功能如何跨任务和架构组成的共享词汇。我们引入相干概率组合主义 (CPC),这是一种解释框架,它将 Transformer 计算建立在相干解释理论的基础上,并通过四个运算符角色来描述它。对齐识别候选关系,统一集成支持信息,抑制减少不兼容的替代方案,路由将选定的信息携带到输出。在来自 5 个架构系列的 15 个模型中,抑制、统一和路由权重空间签名与高于随机基线的保留激活级别角色度量相关。跨任务的抑制比统一更稳定。在 10 个模型中,消除对齐头可减少下游抑制活动,超出随机头控制的范围,但对无冲突提示的类似影响表明一般上游依赖性,而不是矛盾特定的耦合。显性矛盾显着改变了 14 个模型中的分层一致性代理;删除共享残差协方差后,间隙在每个模型中都有预测方向。基础和指令调整的变体保留了归纳头分数结构 ($r{\geq}0.98$),而没有将操作员签名一致地转移到后面的层。这些结果支持 CPC 作为比较 Transformer 机制的共享词汇,同时表明它们的深度和几何表达仍然是特定于体系结构的。