论文

通过顺序蒙特卡罗进行更快的 LLM 推理

Faster LLM Inference via Sequential Monte Carlo

模型推理投机采样

摘要

推测解码 (SD) 通过从廉价的提案模型中起草词元并通过拒绝采样针对昂贵的目标模型进行验证来加速语言模型推理。由于拒绝会在第一个错误时截断草稿块,因此当草稿和目标出现分歧时,吞吐量会降低。我们建议重新调整它们的权重,而不是彻底拒绝草案词元。为此,我们引入了顺序蒙特卡罗 推测解码 (SMC-SD),它通过对一组草案粒子进行重要性加权重采样来取代 词元级 拒绝。 SMC-SD 是一种有原则的近似推理方案,它以准确性换取额外的速度,同时保留每步近似误差的理论界限。由于 LLM 推理受内存带宽限制,因此起草粒子和并行评分所需的算术几乎是免费的 - SMC-SD 使用空闲计算将验证转变为矢量化、固定大小的操作,无需回滚。根据经验,SMC-SD 比 推测解码 实现了 2.36 倍的加速,比自回归解码实现了 5.2 倍的加速,同时在推理、指令跟踪和编码基准方面与目标模型的精度保持在 3% 以内。