论文
D-cut:批量 推测解码 的自适应验证深度修剪
D-cut: Adaptive Verification Depth Pruning for Batched Speculative Decoding
摘要
推测解码 加速 大语言模型 (LLM) 推理,而不影响输出质量。最近的并行起草方法通过将草稿长度与起草延迟解耦来进一步提高单请求性能,从而实现更长的草稿和更高的平均接受词元(MAT)。然而,在高请求并发性下,长草稿会浪费大量计算被拒绝的词元,增加验证成本,并可能使 推测解码 比自回归解码慢。我们提出了 D-Cut,一种自适应修剪方法,可以跨批次联合选择草稿词元,并将验证预算集中在最有可能被接受的词元上。 D-Cut 的灵感源自两个观察结果。首先,不同并发请求的接受长度差异很大;因此,D-Cut 执行交叉请求修剪,根据草稿置信度自适应地分配验证预算。其次,验证成本很大程度上取决于部署环境,包括GPU架构和并行策略; D-Cut 结合了运行时成本模型,以适应目标环境的修剪深度。在密集和混合专家(MoE)模型上的实验表明,在高并发下,D-Cut 将平均加速比从 1.26 倍提高到 1.65 倍,恢复了长草图基线慢于自回归解码的密集模型配置中的加速,并在 MoE 模型上实现了比自回归解码高达 3.0 倍的加速。