论文
DBLAST:随机 推测解码 的相关块起草
DBLAST: Dependent Block Drafting for Stochastic Speculative Decoding
摘要
推测解码 通过使用轻量级起草者提出多个未来词元和验证它们的目标模型来加速 大语言模型 的推理。虽然最近的块和扩散式绘图器可以在一次传递中预测多个位置,但它们的训练和采样程序通常针对贪婪解码进行优化,或者假设绘图块中的位置是有条件独立的。这种假设在非贪婪 推测解码 中变得脆弱,其中目标分布是故意随机的并且多重连续变得合理。我们研究了块扩散绘图员的这种不匹配,并表明可接受的绘图长度随着目标采样分布的熵的增加而降低。我们提出了一个基于词元位置上的低秩潜在混合的依赖块起草器,并辅以直接针对预期验证长度的面向接受的训练目标。在 GSM8K、MT-Bench、HumanEval 和创意写作基准上使用 Qwen3-4B 和 Qwen3-8B 进行的实验表明,我们的方法(即 DBLast)持续改进了独立块采样的接受长度,特别是在较高熵解码机制中。