论文

DFlare:扩大块扩散的草案能力 推测解码

DFlare: Scaling Up Draft Capacity for Block Diffusion Speculative Decoding

模型推理投机采样

摘要

块扩散 推测解码 通过同时预测块内的所有词元以供目标模型并行验证来加速 LLM 推理。一次性预测整个区块需要足够强大的草稿模型并有效利用目标模型的内部知识。然而,最先进的方法 DFlash 限制所有草图层共享仅源自少数目标层的单个融合表示,限制了每层的表达能力并阻碍了草图容量的进一步扩展。在本文中,我们提出了 \modelname,它通过轻量级的逐层融合机制解决了 DFlash 的狭窄条件瓶颈:每个草稿层以可忽略的开销处理大量目标层的自己的可学习组合,同时注入更丰富的目标知识,并为每个草稿层提供不同的输入。这种增强的每层表达能力可以将草稿模型扩展到更深的架构,并具有一致的增益。我们进一步将训练数据从 80 万个样本扩展到 240 万个样本,以充分利用扩大的容量。在涵盖数学推理、代码生成和会话的六个基准测试中,\modelname 在 Qwen3-4B 上实现了 5.52 倍的平均挂钟加速,在 Qwen3-8B 上实现了 5.46 倍,在 GPT-OSS-20B 上实现了 3.91 倍,分别比 DFlash 提高了约 11\%、8\% 和 5\%。我们的代码可以在 https://github.com/Tencent/AngelSlim 获取。