论文

非对称注意力头:Transformer 注意力的结构化头智上下文分配

Asymmetric Attention Heads: Structured Head-Wise Context Allocation for Transformer Attention

模型架构Transformer

摘要

标准多头注意力(MHA)为每个头提供相同的完整因果上下文范围,尽管头可以服务于不同的上下文角色。一些头可能主要依赖于附近的词汇或句法上下文,而另一些头可能依赖于更长期的关系,例如实体交互、话语链接或状态变化。我们提出了不对称注意力头(AAH),这是一种头明智的上下文分配框架,它将上下文长度视为显式的每头或每组分配变量。 AAH 使用特征导出的统计数据对头部进行分组,分层组织这些组,并分配因果局部窗口,同时保留标准的平面 MHA 输出接口。在 4096-tokenseed-0 实验中,几种 AAH 风格的局部分配变体比纯粹的完全注意力实现了更低的验证损失。短期预算消融表明,稳定的本地分配和头窗口分配结构很重要,而固定/本地控制可以与自适应层次结构竞争。我们将 AAH 解释为用于质量和分析的结构化头部上下文分配机制,将注意力覆盖率 (ACR) 报告为选择窗口路由诊断