论文
相关与不相关:Transformer 注意力的重整化群分析
Relevant and Irrelevant: A Renormalization Group Analysis of Transformer Attention
摘要
使用威尔逊重整化群理论 (RG) 的语言,我们将 Transformer 的注意力机制视为训练的 MLP 残差堆栈不动点的扰动,并询问它是否构成相关、边缘或不相关算子。我们推导了一个定点移位公式,并获得了定点几何、有效秩分布、层特异性和扰动衰减谱的四个可测试预测。在具有受控相关长度的合成马尔可夫链序列上进行测试,我们发现:(1)对于大链(长相关),注意力具有很强的相关性:它缩小了 MLP 无法桥接的残余损失间隙,并驱动表示空间中的相变,有效等级跳跃到第 1 层的输入维度之上,并稳定在高维平台。 (2) 对于短链(短相关性),注意力是无关紧要的:Transformer 收敛到与 MLP 相同的损失和定点几何,尽管它收缩扰动更快。 (3) 过渡由第一层头 (L0H0) 主导,它占任何后续头的表征偏移的 4 倍以上,这与 MLP 开始整合位置变化之前相关算子起作用的预测一致。 (4) 扰动衰减实验揭示了状态反转:在长相关状态下,Transformer 选择性地保留慢马尔可夫模式(衰减长度动态范围的 5.4 倍,而 MLP 的动态范围为 1.3 倍);在短相关范围内,它比 MLP 更快地抑制所有模式,且没有光谱选择性。总之,这些结果表明,注意力的相关性不是架构的属性,而是数据生成过程的谱结构的属性,并且一阶 RG 扰动框架提供了这种差异的预测说明。