论文

启动:来自预训练 Transformer 的混合状态空间模型

Priming: Hybrid State Space Models From Pre-trained Transformers

模型架构混合架构

摘要

混合状态空间模型将注意力机制与循环状态空间模型 (SSM) 层相结合,平衡注意力机制的清晰记忆与 SSM 的压缩衰落记忆。与 Transformer 相比,这会产生更小的键值缓存和更快的解码,以及更丰富的架构设计空间。迄今为止,大规模探索设计空间需要从头开始进行训练,这是一个障碍,使大多数大型模型混合研究都局限于狭窄的架构范围内。我们引入了 Priming,这是一种将混合架构设计从 预训练 问题转变为知识转移问题的方法。启动从预先训练的 Transformer 初始化混合模型,并通过短对齐和 后训练 阶段,使用不到 0.5% 的源模型 预训练 词元预算 恢复下游质量。启动与源 Transformer 系列(例如 Qwen、Llama、Mistral)、模型类别(密集或专家混合)和模型规模无关。启动使我们能够在相同条件下大规模运行 SSM 层类型的首次受控比较。我们评估了门控 KalmaNet (GKA)、门控 DeltaNet (GDN) 和 Mamba-2,并表明它们的表达层次 GKA>GDN>Mamba-2 可以直接预测长上下文推理任务的下游性能。我们将 Priming 扩展到具有原生 128K 上下文的 8B/32B 推理模型。我们的混合 GKA 32B 比其源 Qwen3-32B 提高了 +3.8 平均推理点,同时在相同数据上进行后训练的 Transformer 的误差保持在 1% 以内,并实现高达 2.3 倍的解码吞吐量。为了促进混合架构的研究,我们发布了一个用于长上下文推理和指令跟踪的priming混合模型的模型库,以及Priming训练和推理代码(用于长上下文训练的序列并行算法、优化的GKA内核和vLLM服务插件),所有这些都在Apache~2.0许可证下。