论文

ReTrace:推测解码 的拒绝轨迹调节

ReTrace: Rejected-Trajectory Conditioning for Speculative Decoding

模型推理投机采样

摘要

推测解码 通过让轻量级草案模型提出多个候选标记来加速自回归语言模型推理,然后由更大的目标模型并行验证这些候选标记。然而,在第一次拒绝之后,基于标准前缀的验证会丢弃剩余的草稿后缀,因此生成和验证这些位置所花费的计算不会对解码进度做出贡献。着眼于 DFlash,我们表明被拒绝的后缀中被拒绝的位置可能仍然与目标延续保持一致,这表明草稿模型可以保留有用的语义和结构信息,尽管存在局部 词元级 错误。受这一观察的启发并受到条件扩散的启发,我们引入了 ReTrace,这是一种被拒绝的轨迹调节方法,该方法根据上一轮被拒绝的后缀来调节每个草稿块,而不是单独从新的掩模占位符生成它。 ReTrace 保留被拒绝后缀的隐藏表示,将它们与下一个草稿块对齐,使用来自同一验证过程的目标感知校正信号对其进行细化,并通过门控残差融合将它们接纳到起草者的输入嵌入中。由于被拒绝的词元永远不会提交并且目标端验证保持不变,因此 ReTrace 保留了 推测解码 的无损属性,而不需要额外的模型前向传递。对 Qwen3 模型在数学推理、代码生成和开放式对话方面的实验表明,ReTrace 在其 DFlash 主干上不断提高平均接受长度和端到端解码速度。通过引入跨轮调节而不修改轮内提案生成,ReTrace 在很大程度上与现有的起草改进正交,并且可以与它们结合以获得进一步的收益。