论文

DSpark:置信度调度的投机解码与半自回归生成

DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation

模型推理投机采样

摘要

投机解码把草稿生成与目标验证解耦以加速LLM推理。近期的并行草稿器可在单次前向中高效提议长token序列,但因缺乏token间依赖而遭受快速接受衰减;而且不加区分地验证这些扩展块会把关键批处理容量浪费在高拒绝风险的token上,严重降低高并发服务的吞吐。我们提出DSpark:统一高吞吐并行生成与自适应负载感知验证的投机解码框架。为保持草稿质量,DSpark利用半自回归架构——并行骨干耦合轻量顺序模块——引入块内依赖建模、缓解后缀衰减。为优化系统效率,DSpark采用置信度调度验证:基于估计的前缀存活概率与引擎特定吞吐画像,为每个请求动态裁剪验证长度。跨多域离线基准:DSpark大幅提高相对最先进自回归与并行草稿器的接受长度。在DeepSeek-V4服务系统内、真实用户流量下部署:DSpark成功缓解验证浪费;与既定生产基线(MTP-1)相比,在匹配吞吐水平下把每用户生成速度加速60–85%。更重要的是,通过阻止严格交互性约束下的严重吞吐退化,它使能了此前无法达到的性能层级——移动了服务系统的帕累托前沿。

DSpark:置信度调度的投机解码与半自回归生成:论文配图
图 7:吞吐量与 TPS。实时流量下针对每个请求生成速度 (tok/s/user) 的聚合输出令牌吞吐量。在我们的生产部署中,DSpark 在测量流量和引擎配置下相对于 MTP-1 基线改进了观察到的吞吐量交互边界。