论文
重新审视 推测解码 中的有损验证:机制、权衡和故障模式
Revisiting Lossy Verification in Speculative Decoding: Mechanisms, Trade-offs, and Failure Modes
摘要
推测解码 (SD) 通过允许轻量级草稿模型提出词元,然后由更大的目标模型并行验证,从而加速 大语言模型 推理。最近的方法引入了有损验证方案,通过放宽严格的分布匹配来进一步提高效率。然而,这种放松会默默地重写解码分布,而由此产生的加速可能会以不稳定、有时严重降低生成质量为代价。在这项工作中,我们对有损验证方法引起的分布进行了原理分析。我们表明,许多看似不同的方法只是表面上的不同,可以统一为两类:基于截断的验证和协作验证。我们进一步构建了跨策划基准的诊断评估框架。对于基于截断的方法,我们发现了一个基本缺陷:由于分布失真,与真正的截断采样基线相比,性能可能会显着下降。对于协作验证,我们揭示了精心设计的松弛原则,即超调抑制和监督质量,远比草案和目标之间的线性插值更重要。我们的代码可在 https://github.com/ZhouYuxuanYX/Fast-HSD 获取。