论文

短数据,长上下文:提炼 Transformer 中的位置知识

Short Data, Long Context: Distilling Positional Knowledge in Transformers

摘要

扩展语言模型的上下文窗口通常需要昂贵的长上下文 预训练,这对训练效率和数据收集都构成了重大挑战。在本文中,我们提供的证据表明,即使在长上下文窗口中专门对打包的短上下文样本进行训练时,也可以通过基于 logits 的 知识蒸馏 将长上下文检索能力转移到学生模型中。我们通过旋转位置嵌入 (RoPE) 的视角提供全面的见解,并得出三个关键发现。首先,与之前的工作一致,我们证明了分阶段 RoPE 缩放可以在每个训练阶段最大化旋转频谱利用率,并且在 知识蒸馏 设置中也实现了最佳的长上下文性能。其次,我们证明基于 logits 的 知识蒸馏 可以直接实现位置信息传输。使用具有打包重复标记序列的实验设置,我们跟踪查询向量和关键向量通过连续的 Transformer 层到输出 logits 的位置扰动的传播,揭示位置信息系统地影响教师的输出分布,进而影响学生模型接收到的 蒸馏 信号。第三,我们的分析揭示了长上下文扩展期间查询状态的结构化更新模式,不同的参数跨度表现出对长上下文训练的强烈敏感性。