论文

近似值 推测解码

Approximate Speculative Decoding

模型推理投机采样

摘要

推测解码 通过并行验证草稿块与目标模型来加速自回归生成。在标准贪婪验证下,解码在与目标 argmax 不同的第一个草稿标记处停止,丢弃剩余的目标评分后缀。尽管接受这种不匹配会改变解码轨迹,但当连续后缀的标记在已实现的前缀下保持目标贪婪时,它可以使连续后缀可重用。在本文中,我们介绍了 \textbf{Approximate 推测解码 (ASD)},这是一个 无需训练 验证器,它用预算最长前缀选择代替二进制首次不匹配截断。 ASD 接受受本地目标 logits 后悔门、每块异常上限和持久请求级后悔预算约束的选定不匹配,然后重用连续的目标贪婪后缀,而无需额外的近似决策或目标模型前向传递。 ASD 既不需要新的草案模型,也不需要 微调,并且在预算为零时精确地简化为标准贪婪验证。实验表明,与匹配的严格验证相比,ASD 将固定工作负载吞吐量提高了 $3.05\%$--$15.26\%$,并且在七个 Qwen3-14B + DSpark-14B 任务中平均增加了 $7.78\%$。在采用 DSpark 的 DeepSeek-V4-Flash (284B) 上,在 FP4 到 FP8 兼容性设置中,在 GSM8K 和 MATH-500 上,验证方的接受度也提高了大约 10\%$--16\%$。源代码可公开获取:https://github.com/Kissmetothemoon/ASD