论文

xPress:推测解码中扩散草稿器的并行细化

xPress: Parallel Refinement for Diffusion Drafters in Speculative Decoding

模型推理投机采样

摘要

块扩散器,如dFlash,生成整个块的草稿词元,大幅减少了在猜测性解码中多个词元草稿的开销。单步离散去噪过程的关键最后一步涉及使用每个位置的logit分布来条件性地抽样独立的词元。因此,生成的草稿是一个位置的边际分布,而不是联合分布:没有草稿词元会保证依赖其前驱。独立抽样的边际分布倾向于产生单独可能但联合下目标模型分布下不可能的词元,这验证了每个词元条件。这可能导致早期拒绝和限制接受长度。为了解决这个问题,我们提出xPress作为恢复缺失因果关系的方法。xPress是一个轻量级因果细化器,通过并行细化整个扩散块来恢复和传播因果依赖,而无需逐个词元循环。在Qwen3-8B上,在七个数学、代码和聊天基准上,xPress平均提高了接受长度约30%(最高+56%)以及平均1.3的端到端解码吞吐量(最高1.7)。

xPress:推测解码中扩散草稿器的并行细化:论文配图
图4 :马尔可夫头( GSM8K ,块16 , H200/sdpa )的每个块的草案侧延迟的组成。起草者和基础lm_head在头部之间共享;精简器是CUDA绘制的15步串行解码,约为草稿成本的四分之一。