论文
迈向无限长度外推:一种统一方法
Towards Infinite Length Extrapolation: A Unified Approach
摘要
大语言模型(LLM)已给自然语言处理带来变革,但其处理长序列的能力从根本上受限于训练时的上下文窗口大小。现有长度外推方法常常出现性能退化或计算低效。为此,我们采用一个统一框架,将各类位置编码方法重新解释为把注意力得分分解为乘性变换与加性偏置。这一视角不仅涵盖相对位置编码与注意力偏置调制等流行方法,还暴露了它们在处理长程依赖时的固有局限。为弥补这些不足,并在我们框架的启发下,我们提出自适应位置编码(Adaptive Positional Encoding,APE),它利用自适应频率调制以及一个精心设计、包含线性、对数与平方根项的衰减偏置。我们的理论分析确立了无限上下文外推的条件,确保softmax归一化在无界序列上保持良定义,同时保留长程相关性、熵有界性与梯度位置敏感性。我们通过在TinyStories数据集以及一个新的合成数据集——收录最长32,000词故事的Long Tiny Stories——上的实验案例研究印证上述论断。相关代码、数据集与模型权重见 https://anonymous.4open.science/r/Check-2DAD/。
