论文

DeLS-Spec:并行推测起草的解耦长-短上下文

DeLS-Spec: Decoupled Long-Short Contexts for Parallel Speculative Drafting

模型推理投机采样

摘要

推测解码 通过起草多个词元并并行验证它们来加速 LLM 推理。块并行绘图器(例如 DFlash)通过一次性预测整个块来进一步提高绘图效率,但它们的位置预测缺乏明确的块内因果条件。最近的方法,如Domino和DSpark,试图将这种因果关系引入到块并行绘图中,但它们需要从头开始训练绘图模型,这限制了它们的灵活性并增加了训练成本。我们提出了 DeLS-Spec,一种解耦的长短上下文 推测解码 方法。 DeLS-Spec 将固定的 DFlash 模型视为长上下文专家,并引入轻量级本地头作为短上下文专家。本地头可以使用标准的下一个词元预测目标进行独立训练,无需与目标模型或 DFlash 主干进行联合训练,从而导致训练成本极低。在推理时,DeLS-Spec 结合了长上下文和短上下文 logits,并且本地头部不绑定到特定的 DFlash 检查点,使得该方法更加模块化和灵活。 Qwen3 模型上的实验表明,与 DFlash 相比,DeLS-Spec 在数学、代码和对话基准方面持续提高了加速比和平均接受长度。