论文

将树结构推测解码应用于 DeepSeek-V4 以实现高效推理

Adapting Tree-Structured Speculative Decoding to DeepSeek-V4 for Efficient Inference

模型推理投机采样

摘要

自回归解码期间目标模型的重复执行是 LLM 推理延迟的主要来源。与遵循单个候选链的线性推测不同,树结构推测保留来自共享前缀的多个分支;在相同的预算下,更广泛的覆盖范围可以提高接受度和效率。将其适应 DeepSeek-V4 并非易事:其 CSA/HCA 在线压缩注意力将难度集中在目标验证方面,其中从共享前缀分离的分支压缩为不同的状态,从而破坏了跨分支状态一致性。我们通过分支感知因果验证、临时状态隔离和接受路径状态刷新将树结构推测解码集成到 DeepSeek-V4-Flash 管道中,从而保持分支之间的验证和压缩状态更新一致。在预算 D=5 到 D=8、批量大小 1 到 64 以及三个数据集(GSM8K、MBPP、ShareGPT)中,树推测在所有设置中实现了比匹配的线性配置更高的可接受长度(例如,在 D=8 时约为 2.83--3.41 与 2.39--2.84),并且几乎所有配置中的吞吐量(仅在最小预算时是边际的)提高了约 18.5%。更重要的是,收益遵循稳定、可转移的规律:相对收益随着预算的增长而增长,对于中小批量的不可预测工作负载来说最为明显,而超过一定的预算,吞吐量就会趋于稳定,并与仍在上升的可接受长度脱钩。这些结果表明,在相同预算下保留多个候选路径可以有效提高 DeepSeek-V4 解码效率,并为将推测解码适应具有压缩、稀疏或结构化上下文表示的未来模型提供经验。