论文
长上下文感知升级改造:混合 LLM 扩展的新领域
Long-Context Aware Upcycling: A New Frontier for Hybrid LLM Scaling
摘要
将高效 Transformer 组件与线性序列建模模块相结合的混合序列模型是纯 Transformer 的有前途的替代方案,但大多数仍然是从头开始预训练的,因此无法重用现有的 Transformer 检查点。我们研究升级循环作为将预训练的 Transformer LLM 转换为混合架构的实用途径,同时保持短上下文质量并提高长上下文能力。我们将我们的解决方案称为 \emph{HyLo}(混合长上下文):一种长上下文升级配方,它将架构适应与高效的 Transformer 块、多头潜在注意力(MLA)和线性块(Mamba2 或门控 DeltaNet)相结合,并结合分阶段的长上下文训练和教师指导的 蒸馏 以实现稳定优化。 HyLo 通过高效的 后训练 将可用上下文长度扩展了高达 $32\times$,并将 KV 缓存内存减少了 $90\%$ 以上,在我们的 \texttt{vLLM} 推理堆栈中实现了高达 2M 词元的预填充和解码,而类似的 Llama 基线在超过 64K 上下文时就会耗尽内存。在 1B 和 3B 规模设置(基于 Llama 和 Qwen 的变体)中,HyLo 始终提供强大的短上下文和长上下文性能,并且在长上下文评估(例如 RULER)上显着优于最先进的升级混合基线。值得注意的是,在类似的规模下,仅在 10B 词元上训练的 HyLo-Qwen-1.7B 在 GSM8K、Lm-Harness 常识推理和 RULER-64K 上的性能显着优于 JetNemotron(在 400B 词元上训练)。