论文

LibraSpec:通过边际增益驱动优化实现基于动态扩散的 推测解码

LibraSpec: Dynamic Diffusion-Based Speculative Decoding via Marginal-Gain-Driven Optimization

模型推理投机采样

摘要

推测解码 通过起草多个词元进行并行验证来加速 大语言模型 推理,其效率关键取决于每轮解码时选择的推测长度。现有的动态推测方法通过估计将接受多少词元来选择推测长度,这对于顺序生成词元的自回归起草者来说是合理的。然而,最近一波基于扩散的起草者以大大降低的起草成本并行生成候选块,将关键问题从生成多少词元转移到了有多少生成的词元值得验证。因此,我们将动态推测长度选择重新表述为预期加速优化,并得出一个边际标准,仅当其接受增益超过额外的验证成本时才扩展推测序列。在此标准的基础上,我们开发了 \textit{LibraSpec},这是一种 无需训练 和即插即用算法,可使用起草者置信度分数迭代确定推测长度。理论上,我们证明 LibraSpec 单调收敛于最佳推测长度。六个目标模型、三个基于扩散的 推测解码 方法以及数学、编码和聊天基准的实验显示,在贪婪和采样设置下都有一致的改进,与基线相比进一步实现了 $0.5\sim1.5\times$ 的改进,并且比自回归解码实现了高达 $8.49\times$ 的加速。