论文

面向投机生成的并行前缀验证

Parallel Prefix Verification for Speculative Generation

模型推理投机采样

摘要

我们提出PARSE(PArallel pRefix Speculative Engine),一个通过在语义层面并行化前缀验证来加速大语言模型(LLM)推理的投机生成框架。既有投机解码方法根本受限于token级等价:目标模型必须验证每个token,导致接受长度短、加速有限。转向语义或段级验证可以大幅提高接受粒度,但既往方法依赖顺序验证,引入显著开销并限制实际收益。PARSE引入并行前缀验证,实现无需顺序检查的语义级验证。给定草稿模型的完整草稿,目标模型以自定义注意力掩码在单次前向中评估多个前缀的正确性,直接识别最大有效前缀。这消除了顺序段验证,使验证计算高效。PARSE与token级投机解码正交,可与之组合获得额外收益。跨模型与基准,PARSE相对目标模型提供1.25倍至4.3倍的吞吐增益,与EAGLE-3组合时为1.6倍至4.5倍,精度退化可忽略。这证明并行前缀验证是加速LLM推理的有效通用方法。

面向投机生成的并行前缀验证:论文配图
图 1:自回归解码是顺序的、令牌级的; SpecDecode 在令牌级别并行验证(接受范围短); SpecReason 验证语义步骤,但按顺序进行(串行瓶颈)。 Parse 通过在一次预填充中验证草稿的所有语义前缀并从最后一个正确的前缀恢复来填充剩余的象限,从而捕获长接受单元和并行验证。