论文
尖峰、稀疏与汇聚点:大规模激活与注意力汇聚点的解剖
The Spike, the Sparse and the Sink: Anatomy of Massive Activations and Attention Sinks
摘要
我们研究Transformer语言模型中的两个反复出现的现象:massive activations,即少数token在少数通道上表现出极端离群值;attention sinks,即某些token无论语义相关性如何都会吸引不成比例的注意力质量。先前工作观察到这两种现象经常共同出现且常涉及相同的token,但它们的功能角色和因果关系仍不清楚。通过系统实验,我们表明这种共现在很大程度上是现代Transformer设计的架构产物,且两种现象执行相关但不同的功能。Massive activations全局运作:它们诱导在各层间持续的近常数隐表示,实际上充当模型的隐式参数。Attention sinks局部运作:它们调节各头的注意力输出,并使各个头偏向短程依赖。我们识别出pre-norm配置是实现共现的关键选择,并表明消融它会使两种现象解耦。
