论文
Nucleus 推测解码:放宽精确分布的合理性验证
Nucleus Speculative Decoding: Plausibility-Aware Verification Beyond Exact Distribution
摘要
推测性解码通过使用轻量级草稿模型提出多个由目标模型并行验证的 token 来加速自回归生成。然而,标准接受规则侧重于精确的分布校正,并拒绝当草稿模型分配额外概率时在目标模型下仍然高度合理的 token。这种保守的验证限制了每次验证前传后保留的草稿 token 的数量。我们引入了 Nucleus 推测解码 (NSD),这是一种宽松的验证方法,它将目标模型的合理性纳入推测解码中。如果草稿 token 满足标准接受规则或属于目标模型的核心,则 NSD 接受该草稿。我们从理论上描述了我们的方法引入的分布偏差,并表明单步误差完全由草图模型在目标核内的超额概率决定。我们进一步推导了序列级保真度界限,该界限量化了自回归解码中局部偏差如何累积。跨多个目标模型和提议机制的实验表明,NSD 持续提高推测解码效率,同时保持有竞争力的任务性能。我们的方法实现了比自回归解码高达 $5.16\times$ 的吞吐量加速以及比标准推测解码高达 $3.15\times$ 的吞吐量加速。这些改进与更长的可接受长度相一致,允许更多的输出 token 分担每个目标验证通道的成本。分析表明,合理性感知的验证为宽松的验证和推测解码效率提供了一种有效的方法。我们的代码可在 https://github.com/EIT-NLP/Nucleus-Speculative-Decoding. 获取
