论文

SharpDraft:通过基数感知查询扩展加速长上下文推测解码

SharpDraft: Accelerating Long-Context Speculative Decoding with Cardinality-Aware Query Scaling

模型推理投机采样

摘要

长形式推理使得推理成本高昂,推测性解码通过并行验证多个草稿token来减轻这种成本。然而,随着背景的发展和草稿接受度的下降,它的加速可能会减弱。我们关注注意力质量稀释:随着 softmax 对更多可见键进行归一化,集中在得分最高的键上的质量会减少。我们引入了 SharpDraft,这是一种无需训练方法,它通过基数感知的查询扩展来抵消这种影响,而无需在线适应的计算开销。在明确的假设下,我们得出精确的 top-$k$ 质量校正并部署封闭式固定斜率近似。在 AIME-26、GPQA-Diamond 和 LongGenBench Diary 中,当应用于 DFlash、PARD 和 EAGLE 3.1 时,SharpDraft 比仅目标自回归解码实现了 $2.59$-$3.19\times$ 几何平均端到端加速。借助 DFlash,它提高了解码速度,并在端到端加速方面优于完全参数和基于 LoRA 的在线自适应,同时匹配未修改绘图员报告的峰值分配 GPU 记忆。