论文
DEdit:推测解码的迭代草稿编辑
DEdit: Iterative Draft Editing for Speculative Decoding
摘要
推测解码通过让轻量级草稿模型提出目标模型并行验证的词元来加速自回归 LLM。基于扩散的草稿模型通过一次提议多个词元进一步减少起草延迟。然而,这些词元是独立预测的,因此单个早期错误会导致前缀验证丢弃草稿的其余部分,即使它包含有用的下游预测也是如此。我们引入了 DEdit,一种基于扩散的草稿模型,它不仅可以通过传统的并行取消屏蔽来起草,还可以通过词元到词元的预测迭代地编辑其草案。通过编辑,以后的预测可以作为双向上下文来修复早期的错误并扩展可接受的前缀。为了教会模型修复错误,同时保留正确的预测,我们提出了 ProposalMix,这是一种训练方案,它在训练期间根据首次通过置信度将草稿预测与真实词元混合在一起。在 Qwen3-4B 和 Qwen3-8B 的七个基准测试中,DEdit 在评估的草稿模型中实现了最高的宏平均词元接受度和加速比,在贪婪解码下比自回归生成分别达到了 $5.72\times$ 和 $5.97\times$ 的宏平均加速。进一步的分析表明,接受度随着更多的编辑过程和更宽的草稿窗口而提高,并且 ProposalMix 将缩短接受前缀的有害编辑减少了一半。此外,将编辑限制在因果注意力上会降低接受度,尤其是在高度可预测的输出上,这表明未来上下文是这些成果的关键来源。