论文
词元影响力如何随距离衰减:训练语言模型的绿函数视图
How Token Influence Decays with Distance: A Green-Function View of Trained Language Models
摘要
我们研究自回归 Transformer 语言模型的下一个标记预测在早期输入标记嵌入的小扰动下如何变化。在算子学习和微分方程迭代求解器的推动下,我们研究了一个标记对另一个标记的影响如何随着训练模型中的距离而衰减。在微分方程的多级方法中,例如域分解、多重网格和多级预处理,人们经常利用强局部相互作用和较弱但重要的全局相互作用之间的分离。后者对应于格林函数的长尾,通常由粗级运算符处理。受这个观点的启发,我们使用 autograd 计算词元依赖关系的经验、距离解析梯度剖面。对训练有素的 Pythia 模型和 Qwen2.5-0.5B 的实验表明,在测量的距离范围内,中值雅可比灵敏度通过幂律型衰减比通过指数替代更好地描述:对角归一化轮廓可以通过 $$\overline G(r) \approx γ+β(r+1)^{-p}$$ 很好地描述,指数为 $p \approx 0.7$--$0.9$ (通常$0.8$--$0.9$)。此行为出现在古腾堡和 WikiText-103 的连贯文本上。词元洗牌实验表明,即使语法和预测质量崩溃,幂律分布仍然存在,而随机初始化的模型则不会表现出来。因此,缓慢衰减的远程灵敏度似乎是训练有素的自回归 Transformer 算子的学习属性。这些发现表明,语言模型中的分层或粗级机制可能能够利用长尾敏感性配置文件。