论文

DFlow:在块扩散中启用验证者信息流 推测解码

DFlow: Enabling Verifier Information Flow in Block Diffusion Speculative Decoding

模型推理投机采样

摘要

块扩散 推测解码 通过并行提出未来词元块并通过目标模型的单次前向传递来验证它们,从而提高了 LLM 推理效率。然而,现有的方法仅保留接受的前缀并丢弃拒绝的后缀,从而阻止在这些位置上花费的计算有利于后续的起草轮次,并迫使起草者从头开始重复重建未来标记的表示。我们观察到,拒绝仅决定是否可以提交提议的词元,而被拒绝位置的验证者表示仍然可以为后续预测提供有用的信息。基于这一观察,我们提出了 DFlow,这是一个简单而有效的框架,使验证者信息能够在起草轮次中流动。 DFlow 重用目标验证器为被拒绝的后缀生成的隐藏状态来指导后续起草,而无需额外的目标计算。为了有效地学习各轮起草中的信息流,我们引入了一种自条件训练策略,该策略将早期预测中的验证者表示反馈回后续预测中。跨不同基准的 Qwen3 模型实验表明,DFlow 相对于 DFlash 持续提高了草稿质量和接受长度。