论文

DominoTree:推测解码 的 Domino 条件树结构绘图

DominoTree: Conditional Tree-Structured Drafting with Domino for Speculative Decoding

模型推理投机采样

摘要

推测解码 通过起草词元并并行验证它们来加速 LLM 推理。块扩散绘图器(例如 DFlash)仅对每个位置的边缘进行建模,而树方法(例如 DDTree)从这些边缘扩展候选树。发布的 Domino 起草器添加了基于 GRU 的因果校正,使每个草案词元的分发路径依赖,这是 DDTree 的因式分解公式无法表示的结构。我们引入了 DominoTree,这是一种 无需训练 最佳初稿树,通过沿每个根到节点路径的 Domino 条件(非因式分解)校正进行评分,通过将每个节点校正限制为候选 top-M 来使其实用。我们在单流工具和 SGLang 中对它进行了八个基准测试,在 SGLang 中,它作为树外插件在相同的标志下针对 AR、DFlash、EAGLE-3 和 Domino 运行。 DominoTree 在每个服务单元中获得了最高的平均接受长度 - 两种模型大小、单请求和并发负载、上下文为 32K - 以及研究工具中每个温度下的最高总体接受长度(每个数据集单元 24 个单元中的 21 个)。固定起草者、预算和验证者的三臂分解将应用修正所带来的收益(+10.1% 可接受的长度)与沿着每个候选人的实现路径重新计算的收益(+4.7% 以上)分开,这是本文添加的部分。在以验证为主的回合中,吞吐量如下:Qwen3-8B 上的吞吐量比 AR 高出 7.3 倍,在每个温度下的 CUDA 图上击败了已发布的 Domino 解码器,并且在 SGLang 内部,单请求吞吐量比 Qwen3-8B 上的 Domino 高出 12%。在 HELMET 长上下文中,它以 +29-36% 的接受长度和 +10-34% 的吞吐量(在每个长度和两种模型尺寸)上击败 Domino。超过内存受限卡的准入上限后,该链将赢得良好的吞吐量,并且在我们最长的环境中,预填充占主导地位,我们对 EAGLE-3 的领先优势缩小为平局。