论文
边距,非 Windows:无需训练 每步有损 推测解码
Margins, Not Windows: Training-Free Per-Step Lossy Speculative Decoding
摘要
推测解码 通过起草候选词元并并行验证它们来加速 LLM 推理。诸如 EAGLE-3 之类的树注意力起草器被广泛采用,但通常固定两个决策:(1) 严格的词元匹配验证规则和 (2) 静态草稿树形状。先前的工作在限制假设下单独放松了每一项:无需训练 有损验证的长草案链,以及固定 词元预算 下的自适应树整形。我们引入了 AdaptiveSpec,这是一种 无需训练 每步 推测解码 方法,它可以根据解码过程中已生成的内部信号调整两个决策。当起草词元上的目标概率与其 top-1 概率的比率超过阈值时,每步裕度规则会促进不匹配的草案提议词元,而不依赖于草案长度或底层起草者架构。每步树策略直接根据草稿 top-1 置信度的融合信号和捕获最近草稿目标协议的滚动接受历史来调整草稿树的深度、宽度和节点计数,从而允许总草稿计数发生变化而不仅仅是重新分配。这两种适应在正交轴上运行并且实际上是复合的。 AdaptiveSpec 在 SGLang 生产级服务引擎上实施,与最先进的自回归 推测解码 方法 EAGLE-3 相比,吞吐量提高了 56%,在 GSM8K、MATH-500 和 HumanEval 的三个目标模型(DeepSeek-R1-Distill-Llama-8B、 Llama-3.1-8B-指示,Qwen3-8B)。