论文
贡献权重:自注意力的几何分析 Transformer
Contribution Weights: A Geometrical Analysis of Self-Attention Transformers
摘要
分析注意力权重已经成为解释大语言模型(LLM)信息流的标准方法。然而,这种方法有很大的局限性,因为它忽略了被聚合的值向量的几何属性。为了解决这个差距,我们引入了 \emph{贡献权重},这是一种基于投影的度量,通过考虑词元的注意力权重、价值大小以及与层输出的方向对齐来量化词元的影响力。我们证明,贡献权重可以更准确地衡量词元重要性,在跨不同的仅解码器模型、任务和数据集识别语义关键词元方面,贡献权重始终优于基于注意力的指标。此外,我们的指标可以对\emph{注意力池}进行新颖的机制分析。虽然之前的工作将接收器描述为过度关注的被动存储库,但我们揭示了它们发挥着积极的功能作用,通过接收器速率和输出规范之间的凸关系来抑制信息,通过反对低置信度标记的语义漂移来稳定表示。