论文

PRESTO:面向扩散投机解码的前缀对齐树形起草

PRESTO: Prefix-Aligned Tree Drafting for Diffusion Speculative Decoding

模型推理投机采样

摘要

扩散大语言模型(dLLM)已成为自回归(AR)LLM的一种有前景的替代方案,可并行生成token。这使它们成为投机解码(SD)的有效起草模型,可在单次前向传播中产生整块草稿token。然而现有的基于扩散的起草方法依赖线性起草,尽管dLLM会在多个位置发出多个候选token,形成庞大的解码路径组合空间。因此,它们限制了接受长度和解码效率。为利用这种多候选结构,我们将基于树的起草应用于扩散起草器,从而探索多样的候选路径。然而我们发现朴素的树形起草并非最优:扩散边际分布对前缀不敏感(prefix-blind),与基于前缀的AR验证不匹配,导致不可靠的路径排序。我们提出PRESTO,一个原则性框架,通过前缀对齐评分(PREfix-aligned Scoring)与基于优先级的树搜索(priority-based Tree search)实现扩散投机解码(diffusion speculative decOding),将基于树的起草扩展到扩散起草器,同时解决扩散草稿置信度与基于前缀的AR验证之间的根本性不匹配。PRESTO背后的关键原则是:(1)候选排序应与AR验证基于前缀的特性对齐;(2)树构建应优先考虑具有高验证潜力的候选路径,以最大化接受长度。大量实验表明,PRESTO在最先进的专用扩散起草器SD上平均实现最高1.5倍的端到端吞吐加速,在自投机扩散LLM上跨多个基准平均实现1.12倍加速。

PRESTO:面向扩散投机解码的前缀对齐树形起草:论文配图
图 3:在自推测解码下将 PRESTO 应用于混合 dLLM,树预算为 4 个绘图标记。提交的前缀重用了精确的 KV 缓存来对先前草稿树进行 AR 验证,而尾随掩码令牌槽同时针对同一前向传递中基于扩散的推测进行去噪。附加到被拒绝分支的推测输出被丢弃,而沿接受路径的有效推测槽用于下一轮树构建。生成的草稿树被展平为草稿令牌,以便在 AR 树注意力下进行下一次前向传递。 PRESTO 是第一个为自我推测的 dLLM 探索基于树的绘图的框架。详细过程参见附录 C。