论文

感应头插入 N 元语法

Induction Heads Interpolate N-Grams

模型评测模型行为与机制分析

摘要

归纳头是被认为是 Transformer 中上下文学习的基础的注意电路,但它们实现的估计器的精确特征仍然难以捉摸。我们研究了在 $k$ 阶马尔可夫链上训练的 Transformer,并确定了两种互补的平滑机制。首先,在有限的注意力权重范围内,该电路实现了一个软上下文匹配估计器:它聚合来自精确和部分上下文匹配的贡献,通过它们的重叠按指数加权,并在上下文顺序之间引入与数据相关的插值,类似于 Jelinek-Mercer 平滑。其次,序列开始 (BOS) 词元会引发加性伪计数,从而恢复狄利克雷式平滑。我们构建了一个实现这两种机制的解缠结的 Transformer,并表明经过训练的 Transformer 恢复了预测的注意力模式。在伪计数平滑最佳或低阶上下文提供结构化证据的设置中,经过训练的 Transformer 匹配或优于经典的基于计数的基线。我们的结果将感应头的机械解释性与经典的统计平滑联系起来,揭示了 Transformer 学会规范上下文估计而不是简单地计数。