论文

Dustin:使用 推测解码 进行草稿增强稀疏验证以实现高效长上下文生成

Dustin: Draft-Augmented Sparse Verification for Efficient Long-Context Generation with Speculative Decoding

模型推理投机采样

摘要

虽然 推测解码 提高了多批次长上下文 大语言模型 (LLM) 的推理吞吐量,但其效率通常受到验证瓶颈的限制,其中键值 (KV) 缓存加载主导延迟。现有的压缩方法在这种情况下会失败:静态逐出会因显着性偏移而导致准确性损失,而动态选择会在验证路径期间引入令人望而却步的计算开销。我们提出了 Dustin,一个专为长上下文 推测解码 设计的稀疏验证框架。 Dustin 将草稿模型中的前瞻信号与目标模型中的历史注意力相结合,以跨多步验证窗口高保真度地识别关键词元。为了减少重新计算延迟,该方法进一步采用稀疏估计方案,将重要性评分限制为注意力头的最小子集。使用 Qwen2.5-72B 对 PG-19 和 LongBench 进行的评估表明,Dustin 在自注意力方面实现了 27.85 倍的加速,在 32k 序列长度下实现了 9.17 倍的端到端解码加速,所有这些精度下降都可以忽略不计。