论文

EndPrompt:通过终端锚定进行高效的长上下文扩展

EndPrompt: Efficient Long-Context Extension via Terminal Anchoring

模型训练监督微调与指令调优

摘要

扩展 大语言模型 的上下文窗口通常需要对目标长度的序列进行训练,从而产生二次内存和计算成本,使得长上下文适应成本高昂且难以重现。我们提出了 EndPrompt,一种仅使用短训练序列即可实现有效上下文扩展的方法。核心见解是,将模型暴露于远程相对位置距离不需要构造全长输入:我们将原始短上下文保留为完整的第一段,并附加简短的终端提示作为第二段,为其分配接近目标上下文长度的位置索引。这种两段结构在短物理序列内引入了局部和远程相对距离,同时保持了训练文本的语义连续性——这是分割连续上下文的基于块的模拟方法所不具备的属性。我们提供了基于旋转位置嵌入和伯恩斯坦不等式的理论分析,表明位置插值对注意力函数产生了严格的平滑约束,共享的 Transformer 参数进一步抑制了对未观察到的中间距离的不稳定外推。应用于将上下文窗口从 8K 扩展到 64K 的 LLaMA 系列模型中,EndPrompt 的平均 RULER 分数为 76.03,是 LongBench 上的最高平均值,超过了 LCEG (72.24)、LongLoRA (72.95) 和全长 微调 (69.23),同时所需的计算量大大减少。这些结果表明,长上下文泛化可以从稀疏位置监督中诱导出来,挑战了普遍的假设,即密集的长序列训练对于可靠的上下文窗口扩展是必要的。该代码可在 https://github.com/clx1415926/EndPrompt 获取。