论文

AdaRoPE:并非所有注意力头都应等频等幅旋转

AdaRoPE: Not All Attention Heads Should Rotate and Scale Equally

模型架构Transformer

摘要

旋转位置嵌入(RoPE)在Transformer中被广泛用于编码位置信息,但标准实现对所有注意力头强制统一的频率调度与缩放。我们用简化检索任务与长度泛化场景,从经验与理论两方面证明:承担不同功能角色的头需要不同的频率范围与注意力缩放因子才能有效运作。忽视这一结构导致嵌入维度利用不佳与性能退化,长上下文设定下尤甚。为解决这些局限,我们提出AdaRoPE:为每个注意力头配备可学习的旋转频率与注意力缩放因子。带AdaRoPE的预训练LLM持续优于现有RoPE变体,包括partial RoPE与NoPE基线。对上下文扩展,我们进一步证明YaRN等方法使用的统一频率与注意力缩放是次优的:经头特定缩放,AdaRoPE实现更好的上下文扩展,同时在外推设定与长上下文继续预训练设定下都更好地保持短上下文性能。这些结果凸显在单个注意力头层面优化旋转位置嵌入的重要性。

AdaRoPE:并非所有注意力头都应等频等幅旋转:论文配图
图 1:RoPE 频率的窗口相关稀疏利用率。我们分析了不同相对距离 Δ\Delta 处的查询 qq 和关键 kk 之间的每个维度对对注意力 logit 的贡献,其中颜色表示每个 RoPE 维度对的 Σiqi​ki\sum_{i}q_{i}k_{i} 。深红色或蓝色表示较大幅度的 Logit 贡献。它在不同的相对距离上清楚地表现出不同的周期性模式。我们绘制 Dim=8,c=512\text{Dim}=8,c=512 和 0​p​t=320pt=32 的情况。左图:标准 RoPE 主要使用第二对 RoPE,其他尺寸几乎未使用。中:具有学习频率的 RoPE(AdaFreq)通过调整频率有效地利用所有注意力维度,大量具有大绝对值的单元格证明了这一点。右:平均评估精度与窗口宽度 0​p​t0pt。与学习方法相比,固定 RoPE 基线的准确度明显较低,因为其频率利用率不理想。