上限接受直方图表明块扩散中的搁浅加速 推测解码
Ceiling-Clipped Acceptance Histograms Indicate Stranded Speed-up in Block-Diffusion Speculative Decoding
摘要
推测解码 通过高效的草稿模型(起草者)加快生成速度,该模型为目标模型提出词元以一次性验证,从而保留目标的输出分布。 DFlash 和 DFlare 等高接受度块扩散牵伸机可在一次平行通道中填充整个块。在许多周期中,目标接受整个块,因此起草者在验证失败之前耗尽其经过训练的块范围。我们称这种未实现的接受搁浅加速。每个提示或每个周期的平均提交长度将其隐藏,而接受直方图将其暴露为天花板箱中的尖峰,即接受整个块的周期的分数。我们建议在进行训练计算之前使用直方图作为飞行前检查。天真地扩大推理时的块并不能恢复加速,因为一旦块增长超过其训练大小,绘图者的双向注意力即使在早期位置也会改变其分布,并削弱块前验证。相反,我们在较长的模块上对绘图员进行后训练,并使用简短的课程来强调新暴露的位置,我们称之为 DBloom 的方法。将 Qwen3-8B 和 Qwen3-4B 目标上的预训练 DFlash 和 DFlare 起草器从块大小 16 扩展到 24,将高上限基准上的每个提示承诺长度中位数提高了 +0.8 个词元(最多 +1.1)。一旦延续 微调 在扩展之前,增加量将达到 1.37 个词元。同样的扩展还将不同模型系列 Gemma-4-12B-IT 的所有七个基准的承诺长度中位数提高了 +0.41 个词元(A 臂),而完整的延续然后扩展管道(B 臂)比同一个 B16 起草器增加了 +0.29 到 +0.98 个词元。在与 JetSpec(我们的设计中未使用的当代基于树的绘图器)的即时匹配比较中,DBloom 在树预算最多 64 个节点的每个基准上提交了更多词元。