论文

为什么累积变换可以推断?

Why Do Accumulated Transformations Extrapolate?

模型架构Transformer

摘要

Path Attention 表明,用累积的数据相关的 Householder 反射替换 RoPE 的位置索引旋转会产生强大的长度外推,尽管在极端上下文长度下性能会下降。我们询问这是否取决于特定于 Householder 的结构,或者反映了沿着源到查询路径累积转换的一般属性。我们研究了一种更简单的变体,保持 RoPE 的块对角 SO(2) 旋转,但用累积的词元相关角度替换位置索引角度。它显示了相同的模式:在长上下文中外推得到改进,然后退化。我们证明结果扩展到满足某些规律性条件的累积正交变换:它们的乘积在有限多个步骤后变得不连贯,抑制了对远处标记的关注。查询和键的累积旋转创建了一个独立于上下文长度的有限混合窗口;在训练中学习到的每个词元抑制在任何评估长度上都保持不变,并且高维集中产生了抑制远词元的分数差距,而近路由传输保留了目标信号。相反,下限表明累积的旋转最终必定会退化:随着远集的增长,如果没有明确的远质量控制,任何旋转都无法保留近处的信号。对于 SO(2) 旋转,旋转值也会使残余远贡献不连贯地组合,从而扩大范围。受控实验支持这些预测:随机累积旋转极大地改进了 RoPE 的外推,学习的词元相关旋转保持了远远超出训练上下文的接近训练长度的困惑,并且旋转值有助于单独查询和键。仅旋转模型在极端长度下仍然会退化,而 ALiBi 保持长度稳定,符合远质量控制的需要。