论文

TAPS:面向扩散草稿投机解码的目标感知前缀树选择

TAPS: Target-Aware Prefix Tree Selection for Diffusion-Drafted Speculative Decoding

模型推理投机采样

摘要

用扩散模型进行并行草稿生成是投机解码的一种有前景的方法。通过在单次前向传播中预测多个未来位置的token,扩散草稿模型大幅降低草稿生成延迟。但这把瓶颈转移到验证环节:验证单条序列限制了接受长度,而验证大型草稿树又带来过高的目标模型延迟。我们发现现有草稿树方法的一个关键失配:现有扩散树方法按边际概率对节点排序,忽视了验证是以前缀为条件的。结果,它们可能验证被拒绝前缀的不可达后代,在收益有限的情况下增加了延迟。为解决这一问题,我们提出TAPS,一种目标感知的前缀选择方法,将扩散边际概率转化为路径条件化的接受率估计。TAPS随后在固定验证预算下选择紧凑的前缀封闭子树,改善接受-成本权衡,而不是简单扩大草稿树。跨多个数据集与模型家族的实验表明,TAPS相对朴素自回归解码实现最高7.9倍的无损端到端加速,分别以1.36倍和1.74倍优于最先进的DFlash与DDTree。我们的工作已发布于 https://anonymous.4open.science/r/TAPS-EMNLP2026-53DD。

TAPS:面向扩散草稿投机解码的目标感知前缀树选择:论文配图
图 1:总体吞吐量与接受度的权衡。我们比较了 Qwen3-4B 和 Qwen3-8B 设置下的 DFlash、DDTree 和 TAPS,并在 A40 GPU 上的所有基准测试中取平均值。与之前的方法相比,TAPS 实现了更好的吞吐量-接受权衡,提高了吞吐量,同时保持了有竞争力的接受长度。