论文
BlockPilot:基于扩散的实例自适应策略学习 推测解码
BlockPilot: Instance-Adaptive Policy Learning for Diffusion-based Speculative Decoding
摘要
推测解码通过轻量级草稿模型并行生成候选token,加速推理,再由目标模型验证,实现无损加速。最近,基于扩散的 推测解码 通过块级扩散在每次前向传递中生成多个词元,进一步提高了并行性,从而实现了最先进的 (SOTA) 性能。然而,现有方法采用固定的推理块大小,并在所有输入上假设统一的最佳解码策略。在本文中,我们表明这种假设不是最优的,因为最佳块大小因样本而异,并且在 推测解码 性能中起着关键作用。此外,这些值表现出清晰的局部结构,集中在训练块大小周围,从而将问题简化为低维和结构化决策空间。基于这些见解,我们提出了 BlockPilot,这是一种样本自适应策略,可以根据预填充表示来预测最佳块大小。具体来说,我们将块大小选择制定为轻量级策略学习问题,并提出一种实例自适应决策机制,该机制根据预填充阶段的表示来预测最佳块大小。预填充后仅执行一次预测,从而实现无缝集成。大量实验表明,我们的方法是即插即用的,引入的开销最小,并且持续提高效率,在温度 $T=1$ 下,在 Qwen3-4B 上实现了 5.92 的接受长度和 4.20$\times$ 的加速比。