论文
AdaRoPE:并非所有注意力头都应等频等幅旋转
AdaRoPE: Not All Attention Heads Should Rotate and Scale Equally
摘要
旋转位置嵌入(RoPE)在Transformer中被广泛用于编码位置信息,但标准实现对所有注意力头强制统一的频率调度与缩放。我们用简化检索任务与长度泛化场景,从经验与理论两方面证明:承担不同功能角色的头需要不同的频率范围与注意力缩放因子才能有效运作。忽视这一结构导致嵌入维度利用不佳与性能退化,长上下文设定下尤甚。为解决这些局限,我们提出AdaRoPE:为每个注意力头配备可学习的旋转频率与注意力缩放因子。带AdaRoPE的预训练LLM持续优于现有RoPE变体,包括partial RoPE与NoPE基线。对上下文扩展,我们进一步证明YaRN等方法使用的统一频率与注意力缩放是次优的:经头特定缩放,AdaRoPE实现更好的上下文扩展,同时在外推设定与长上下文继续预训练设定下都更好地保持短上下文性能。这些结果凸显在单个注意力头层面优化旋转位置嵌入的重要性。
