论文

Jet-Long:利用动态双焦点 RoPE 进行高效的长上下文扩展

Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE

模型架构Transformer

摘要

现代 LLM 越来越多地部署在长上下文应用程序中,例如检索增强生成、存储库级编码和代理工作流程,其累积的推理和工具跟踪通常会将输入推到预训练窗口之外的数量级,从而使零样本上下文扩展成为开放权重检查点的主要部署路径。占主导地位的零样本方法(YaRN、Self-Extend、DCA)预先修复了单个缩放因子,因此激进的因子会牺牲短上下文保真度,而保守的因子会在长上下文中崩溃;最近的长度感知变体适应了映射,但具有合适的或依赖于距离的时间表。我们提出了 Jet-Long,一种免调整的零样本方法,它将本地 RoPE 忠实窗口与远程窗口配对,其缩放因子通过无参数分析计划动态适应当前序列长度,在短输入处精确恢复基本模型,同时在长输入处干净地外推。包含排除注意力合并和动态 RoPE 校正可实现融合的 CuTe 实现。在 64K-128K 的 H100 上,预填充在评估的 Qwen3 尺寸上保留了 FlashAttention-3 吞吐量的 83-88%,以及匹配的 CuTe 控制的 88-93%; Qwen3-8B 单批次生成达到 FlashAttention-3 吞吐量的 1.04-1.08 倍。在 Qwen3-1.7B/4B/8B 高达 128K 的上下文中,Jet-Long 比 1.7B/4B/8B 的最强基线领先 RULER +4.79/+2.18/+2.03 个百分点,在 HELMET-RAG(HELMET 确定的基准,下游长上下文性能最有效的预测器)上实现了最佳整体准确度,并获得最低的 PG-19困惑。其他评估涵盖 Meta-Llama-3-8B、训练后的 Qwen3 检查点和混合 Jet-Nemotron 架构,无需重新训练即可支持更广泛的适用性。本地窗口超参数在测试设置中保持稳健。