论文

D-Loop:用于推测解码的循环扩散绘图

D-Loop: Looped Diffusion Drafting for Speculative Decoding

模型推理投机采样

摘要

块扩散通过在一次前向传递中起草多个token来加速推测解码。然而,每个位置都预测边缘分布,而没有观察早期提出的token,从而限制了草稿质量和接受长度。我们确定了一个具体的故障,即 重复陷阱,其中相邻位置产生相同token的冗余副本。我们从理论上解释了这种趋势,并根据经验检验了它与较短的已接受草稿的关联。最近的方法通过额外的因果头或单独训练的绘图员来细化边际预测,增加参数存储并引入单独的训练目标。相反,我们提出了 D-Loop,它在原始扩散绘图器中引入了 块内因果条件,而无需额外的模型组件。受半自回归生成和参数共享的启发,D-Loop 在循环过程中重复使用相同的骨干模型。第一遍提出一个块,第二遍以选定的前缀为条件来并行重新生成后缀。互补的前缀-后缀目标训练共享起草者进行仅锚定前缀预测和前缀条件后缀预测。在八个数学、代码和聊天基准测试中,D-Loop 在 Qwen3-4B 和 Qwen3-8B 上击败了 DFlash 和 DSpark,并取得了明显的进步。