论文
草稿更少,检索更多:推测解码 的混合树构建
Draft Less, Retrieve More: Hybrid Tree Construction for Speculative Decoding
摘要
推测解码 (SD) 通过利用先起草后验证的范例来加速 大语言模型 推理。为了最大限度地提高接受率,最近的方法构建了广泛的草稿树,不幸的是,这会产生严重的 VRAM 带宽和计算开销,从而成为端到端加速的瓶颈。虽然动态深度修剪可以通过删除边缘分支来减少这种延迟,但它也会丢弃潜在的有效候选者,从而防止接受率达到密集树的上限。在本文中,我们确定了资源分配的一个关键机会:从密集绘图到修剪绘图的转变释放了大量的计算预算。为了打破这种帕累托权衡,我们引入了 Graft,一种将修剪和检索结合起来作为相辅相成的操作的补偿框架。剪枝为检索提供足够的预算,而检索则补偿剪枝引起的覆盖损失并恢复可接受的长度。通过采用顺序的“修剪然后移植”机制,Graft 将高度预测的检索到的词元附加到通过修剪打开的位置,以接近零的开销填充拓扑间隙。移植完全是无需训练并且无损。综合评估表明,Graft 在实际部署设置中建立了新的帕累托前沿,包括短上下文生成、长上下文生成和大规模模型。在短上下文基准测试中,它实现了高达 5.41$\times$ 的加速,并且在大型 Qwen3-235B 上比 EAGLE-3 的平均加速提高了 21.8%。我们还提供了将 Graft 应用到 DFlash 式块绘图范例的初步探索,为将嫁接扩展到自回归绘图树之外提供了初步证据和见解。