论文
GPT-2 中注意力下沉的机制解释:一个回路,对缓解措施的更广泛影响
A Mechanistic Account of Attention Sinks in GPT-2: One Circuit, Broader Implications for Mitigation
摘要
Transformer 通常表现出注意力下沉:对第一位置的关注度过高。我们在具有学习查询偏差和绝对位置嵌入的 GPT-2 风格模型中研究这种行为。将结构分析与因果干预相结合,并在自然语言、数学和代码输入中进行验证,我们发现汇是由 (i) 学习到的查询偏差、(ii) 位置编码的第一层 MLP 转换和 (iii) 键投影中的结构之间的相互作用产生的。至关重要的是,我们确定的每个组件都是单独可有可无的:省略每个组件的架构都会稳健地表现出水槽。这表明注意力池可能是通过跨架构的不同电路产生的。这些发现为汇的缓解提供了信息,并激发了对汇出现原因的更广泛调查。