论文
测试时推测
Test-Time Speculation
摘要
推测解码 通过使用快速草稿模型生成词元和更准确的目标模型来验证它们来加速 LLM 推理。它的性能取决于$\textit{接受长度}$,或目标接受的草案词元的数量。我们的研究表明,即使是最先进的投机者(如 DFlash、EAGLE-3 和 PARD)的接受长度也会随着生成长度的增加而降低,在短短几千个输出词元内达到接近 1 的值(即没有加速),使得投机者对于长响应任务无效。接受长度下降是因为大多数投机者都在短序列上进行离线训练,但在推理时被迫在更长的输出上匹配目标模型,远远超出了他们的训练分布。为了解决这个问题,我们提出了$\textit{测试时推测(TTS)}$,这是一种在线 蒸馏 方法,可以在测试时不断调整推测器。 TTS 利用了词元验证步骤已经调用每个草稿词元的目标模型的关键见解,无需额外成本即可提供调整草稿所需的训练信号。 TTS 将草稿视为学生,将目标视为老师,通过几轮推测来调整草稿,随着生成的进行,每次更新都会提高草稿的准确性。我们对 Qwen-3、Qwen-3.5 和 Llama3.1 系列多个模型的结果表明,与最先进的投机者相比,TTS 的接受长度平均提高了 72\%$ 和 41\%$,并且收益随着生成长度的增加而扩大。