论文
复制或不复制:通过内在模型信号控制推测解码
To Copy or Not to Copy: Controlling Speculative Decoding via Intrinsic Model Signals
摘要
推测解码 (SD) 显着加速了大型语言模型 (LLM) 推理,但现有方法面临两种起草策略之间的基本权衡:神经起草和基于上下文的复制。神经草稿(例如 EAGLE3)在不同的文本设置中提供了强大的性能,而基于复制的方法通过更快地生成候选者并利用长重复跨度进行近乎完美的推测,从而在复制密集型机制中实现更高的加速。我们分析了现有的基于复制的方法,发现它们很容易出现意外重复,其中表面级 n 元语法重叠不能反映复制的结构意图,从而导致误报触发,最终降低吞吐量。我们介绍 SwitchSD,一个自适应框架,将复制视为 LLM 的潜在控制信号。通过在目标模型的内部表示上训练轻量级探针,SwitchSD 可以高精度识别真正的复制意图(AUC > 0.99)。这使得系统能够在神经绘图(例如 EAGLE)和基于上下文的复制之间动态切换。我们在 Llama 和 Qwen 系列中的结果表明,与 EAGLE3 等最先进的基线相比,吞吐量提高了高达 15%,有效地将复制从嘈杂的启发式方法转变为有原则的、模型感知的解码机制。