论文

整体的稀疏一瞥:无火车的自我推测解码

A Sparse Glimpse of the Whole: Train-Free Self-Speculative Decoding

模型推理投机采样

摘要

推测解码 缓解了 大语言模型 推理中的内存带宽瓶颈,但其加速受到起草开销、词元接受和推测长度的共同限制。我们提出了统一的效率分析,表明当边际接受概率低于相对起草成本时,扩展推测范围可以减少而不是提高加速。在此分析的指导下,我们引入了 SparseSpec-L,这是一个用于长上下文推理的 无需训练 自 推测解码 框架。 SparseSpec-L 使用动态稀疏且可调用的 KV 缓存直接从目标模型生成轻量级草稿。它回收全上下文验证过程中产生的每头注意力统计数据作为无额外前向重要性信号,允许调用关键的历史词元,而无需永久丢弃密集的 KV 缓存。基于在线熵的控制器进一步根据预期的逐步效率选择推测长度。跨多个长上下文任务和模型规模的实验显示了一致的端到端加速,在保持目标模型的输出分布的同时,比自回归解码加速。