论文
注意力集中的统一观点:从机制到架构干预
A Unifying View of Attention Sinks: From Mechanisms to Architectural Interventions
摘要
当注意力集中在单个词元(接收器)上时,模型实际计算的是什么?注意池在 softmax Transformer 中无处不在,但这种共享的视觉签名可以隐藏根本不同的算法。我们表明,视觉上相似的接收器模式可以反映两种不同的机制:(i)自适应 nop,其中头通过路由到空词元来抑制其更新,以及(ii)广播,其中接收器聚合并重新分配全局信息。每种机制都会留下不同的痕迹(nop 接收器表现出可忽略不计的价值规范;广播接收器会导致低秩输出),我们将其形式化为合成任务并用于导出实用的诊断。应用于预训练视觉 Transformer 时,这些诊断表明这两种机制大规模存在:从早期层的 CLS 过渡到更深层的补丁,并集中在专门的头部。因果干预进一步将这些特征与近零抑制和共享剩余贡献联系起来。然后,我们使用架构干预来展示如何重新组织这些计算:门控消除了检测到的类似 nop 的接收器,但增加了类似广播的接收器,寄存器重新定位而不是删除接收器计算,并且我们的无位置全局路径为共享通信提供了一条显式路径,减少了由门控引起的类似广播的接收器。在密集探针上,尽管保留了一些类似广播的接收器,但将门控与全局路径相结合在测试的变体中给出了最强的结果。总的来说,我们发现相同的注意力模式可以反映两种截然不同的计算,并且有效的干预不仅取决于识别计算,还取决于提供模型可以重新组织计算的架构替代方案。