论文

多标记残差预测

Multi-Token Residual Prediction

模型推理投机采样

摘要

扩散语言模型 (DLM) 通过迭代地对屏蔽标记序列进行去噪来生成文本,与自回归模型相比,它在并行性和质量之间提供了权衡。在当前实践中,每步解码的词元数量由置信度阈值控制,并且随着每步对更多词元进行去噪,质量单调下降。我们引入了多词元残差预测(MRP),这是一个轻量级模块,可以在单个骨干前向传递中实现依赖性感知的多词元去噪。 MRP 利用了去噪过程​​的一个关键特性:相邻去噪步骤的 logits 分布非常相似。 MRP 不是第二次运行主干网来获取下一步 logits,而是根据主干网的隐藏状态预测步骤之间的残差,从而以一小部分成本有效地对每个主干网前向的更多词元进行去噪。我们将 MRP 应用于 DLM 解码的两种操作机制。在高质量低吞吐量静态去噪机制中,MRP 充当 推测解码 的起草者:其建议针对主干网进行验证,在 SGLang 中产生高达 1.4 倍的无损加速。在低质量高吞吐量的动态去噪机制中,MRP 相反驱动了一种重新屏蔽方案,该方案撤销了过度渴望的揭示,恢复了因激进的低阈值解码而损失的大部分准确性,并将代码生成任务 HumanEval 的准确性提高了 22.6 分,推理任务 GSM8K 的准确性提高了 17.7 分。