论文
打乱上下文:RoPE 扰动的自 蒸馏 用于长上下文适应
Shuffle the Context: RoPE-Perturbed Self-Distillation for Long-Context Adaptation
摘要
大语言模型 (LLM) 越来越多地在需要可靠的长上下文理解的环境中运行,例如检索增强生成和多文档推理。一种常见的策略是在目标序列长度上微调预训练的短上下文模型。然而,我们发现标准的长上下文适应仍然很脆弱:模型的准确性在很大程度上取决于相关证据的绝对位置,即使在控制任务格式和难度时也表现出很高的位置方差。我们提出了 RoPE-Perturbed Self-蒸馏,这是一种提高位置鲁棒性的训练正则化器。核心思想是通过扰动 RoPE 指数(有效地将部分上下文移动到不同位置)来形成同一训练序列的替代“视图”,并通过 self-蒸馏 训练模型以在视图之间产生一致的预测。这鼓励对语义信号的依赖,而不是脆弱的位置依赖。 Llama-3-8B 和 Qwen-3-4B 的长上下文适应实验表明,在长上下文基准上取得了一致的收益,包括 SFT 后 Llama-3-8B 的 RULER-64K 提高了 12.04%,Qwen-3-4B 的 RULER-256K 提高了 2.71%,同时改进了超出训练上下文窗口的长度外推。