论文

Domino:在 推测解码 中将因果建模与自回归绘图解耦

Domino: Decoupling Causal Modeling from Autoregressive Drafting in Speculative Decoding

模型推理投机采样

摘要

推测解码 通过起草多个词元并与目标模型并行验证它们来加速 LLM 推理。然而,其实际加速受到草稿质量和起草成本之间的权衡的限制:自回归起草者对草稿词元之间的因果依赖关系进行建模,但会产生顺序开销,而并行起草者降低了起草成本,但削弱了块内依赖关系建模。在本文中,我们提出了 Domino,一个 推测解码 框架,它将因果依赖建模与昂贵的自回归草稿执行分离。 Domino 首先使用并行草稿主干为整个块生成初步草稿分布,然后应用轻量级 Domino 头通过依赖于前缀的因果信息来细化它们。为了稳定教师强制的因果编码,我们进一步引入了基础锚定训练课程,该课程首先加强并行主干,然后逐渐将优化转向因果校正的最终分布。在 Qwen3 模型上的实验表明,Domino 在 Transformer 后端下实现了高达 5.49 倍的端到端加速,在 SGLang 服务下实现了高达 5.8 倍的吞吐量加速。