论文

CURE:块并行推测解码的局部不确定性修复

CURE: Local Uncertainty Repair for Block-Parallel Speculative Decoding

模型推理投机采样

摘要

冒犯性解码通过在目标验证与生成草稿之间交替,缓解了自动回归大语言模型(LLMs)的延迟问题。然而,现有的并行生成后端通常在长序列上表现出快速的准确度下降,导致验证过程中高拒绝率和较差的时钟速度提升。我们观察到生成错误并不均匀分布,而是通常源于高不确定性令牌,这些令牌会扰乱下游生成轨迹。受此错误模式的启发,我们提出了CURE,一种预算-aware动态修复树,旨在在不确定性焦点处修复错误,而不产生不可接受的树验证开销。具体来说,我们的方法使用预测的置信度边际来动态定位候选错误令牌,仅在脆弱节点上扩展可扩展的修复路径,并使用一种新颖的修复重同步机制来在验证后重新对齐生成状态。在代码生成基准(HumanEval、MBPP和LiveCodeBench-lite)和数学推理基准(GSM8K)上的评估表明,CURE在并行基准的基础上增加了平均接受长度4.2-7.5%,从而将目标解码后的整体速度提升2.66-3.49倍。此外,我们提供了一个插件式修复模块,兼容标准的并行生成后端。我们还对生成计算与验证效率之间的权衡进行了刻画。

CURE:块并行推测解码的局部不确定性修复:论文配图
图1:CURE 的一次解码迭代。分块并行草稿生成分支0,同时给出各位置的不确定性边际。低边际位置获得有限的修复预算;目标模型在单次运行中同时验证分支0和由此产生的修复路径。框架选择被接受的最长前缀,且仅在修复路径获胜时重新同步草稿缓存。