论文
Osprey:由预训练小语言模型构建可跨目标迁移的推测解码草稿模型
Osprey: Target-agnostic Pre-training Makes Stronger Drafters in Speculative Decoding
摘要
推测解码对加速大语言模型推理很重要,但加速收益并不稳定:草稿模型通常针对单一目标模型的狭窄分布训练,工作负载变化时接受率会大幅下降。这与现代大语言模型通过大规模预训练获得广泛泛化能力的路线形成反差。我们认为自然的解决办法是预训练,但既有草稿模型依赖目标模型的隐藏状态并在其logits上蒸馏,因此需为每个目标重复预训练。Osprey从现成的预训练小语言模型构建草稿模型,把广泛预训练作为可复用、不依赖特定目标的基础,每个目标只需轻量适配。实现这一点需解决两个问题:小语言模型远比低延迟草稿模型所允许的结构更深;在学习接收目标隐藏状态、输出目标词表中的词元时,还要保留预训练计算能力。Osprey先剪枝为浅层骨干,通过不依赖特定目标的下一词元预训练恢复语言建模能力,再以词表对齐、零初始化QKV扩展及目标输出分布蒸馏适配各个目标。实验中,同一预训练骨干可跨目标迁移,Qwen3-8B、Llama-3.3-70B-Instruct及229B MiniMax-M2.5的平均接受长度分别增加16.1%、21.2%和22.7%,后者每秒词元数增加17.5%;域外及多语言数据上的收益最大。代码:https://github.com/LeanModels/Osprey。