论文

EvoSpec:通过实时词汇和参数适应改进 推测解码

EvoSpec: Evolving Speculative Decoding via Real-Time Vocabulary and Parameter Adaptation

模型推理投机采样

摘要

推测解码 通过先草稿后验证的生成加速 大语言模型 推理,但轻量级草稿模型面临耦合效率和质量限制:大词汇量输出投影成本高昂,而有限的草稿容量和静态参数降低了专业或转移输入下的接受度。词汇修剪降低了预测成本,但静态变体会错过本地重要的长尾标记,而动态变体仍然对预设的选择策略和预算敏感。此外,即使目标词元被覆盖,有限的草案容量也可能导致草案分布错位。在线对齐可提高草稿质量,但全参数更新会带来大量内存和延迟开销。我们引入了 EvoSpec,它联合调整来自验证反馈的活动词汇和轻量级草稿参数。 EvoSpec 异步检索语义和统计标记邻居,并执行课程加权的在线 LoRA 对齐,同时保留精确的目标模型验证。在 Qwen3-8B/EAGLE-2 上,EvoSpec 比普通解码实现了 $2.18\times$ 加速,比 EAGLE-2 提高了 $1.20\times$,同时提高了专用域覆盖范围,并且比全参数在线自适应少使用了 $27\%$ 辅助 GPU 自适应内存。