论文

RoPE 在长上下文中的位置与词元区分限制

RoPE Distinguishes Neither Positions Nor Tokens in Long Contexts, Provably

模型评测模型行为与机制分析

摘要

我们确定了基于 Transformer 的长上下文语言模型中旋转位置嵌入 (RoPE) 的内在局限性。我们的理论分析脱离了上下文的具体内容,仅取决于其长度。我们证明,随着上下文长度的增加,基于 RoPE 的注意力变得不可预测,并失去了对其有效性至关重要的两个属性。首先,它失去了局部性偏见:RoPE 不太可能比更远的位置更青睐较近的位置。其次,它失去了标记相关性的一致性:在一个位置获得比替代选项更高的关注分数的关键向量可能在另一位置获得较低的分数。在这两种情况下,失败的概率都接近 0.5,并不比随机猜测好。我们进一步证明,当关键词元移动到不同的位置,甚至被不同的词元替换时,注意力分数可以保持不变,这表明无法区分位置或词元。调整 RoPE 基础会权衡区分位置和区分词元,但不能同时保留两者。增加 RoPE 基础超参数是当今长上下文模型中的常见做法,有助于区分不同的 token,但不可避免地牺牲了区分位置的能力。我们的实证分析表明,多头、多层架构不足以克服这些限制。我们的研究结果表明,未来的 Transformer 长上下文语言模型可能需要编码位置和标记顺序的全新机制。