论文

RACER:检索增强上下文快速 推测解码

RACER: Retrieval-Augmented Contextual Rapid Speculative Decoding

模型推理投机采样

摘要

大语言模型 (LLM) 中的自回归解码每步生成一个词元,导致推理延迟较高。 推测解码 (SD) 通过猜测和验证策略缓解了这一问题,但现有的 无需训练 变体面临着权衡:当不存在精确匹配时,基于检索的草稿会中断,而基于 logits 的草稿缺乏结构指导。我们提出 $\textbf{RACER}$ ($\textbf{R}$etrieval-$\textbf{A}$ugmented $\textbf{C}$ont$\textbf{e}$xtual $\textbf{R}$apid 推测解码),一种轻量级的 无需训练 方法,它将检索到的精确模式与logits驱动的未来线索。这种统一提供了可靠的锚定和灵活的外推,产生更丰富的投机草案。 Spec-Bench、HumanEval 和 MGSM-ZH 上的实验表明,RACER 持续加速推理,比自回归解码实现超过 2 倍的加速,并且优于之前的 无需训练 方法,为高效 LLM 解码提供可扩展、即插即用的解决方案。我们的源代码可在 $\href{https://github.com/hkr04/RACER}{https://github.com/hkr04/RACER}$ 获取。