论文
PRESTO:面向扩散投机解码的前缀对齐树形起草
PRESTO: Prefix-Aligned Tree Drafting for Diffusion Speculative Decoding
摘要
扩散大语言模型(dLLM)已成为自回归(AR)LLM的一种有前景的替代方案,可并行生成token。这使它们成为投机解码(SD)的有效起草模型,可在单次前向传播中产生整块草稿token。然而现有的基于扩散的起草方法依赖线性起草,尽管dLLM会在多个位置发出多个候选token,形成庞大的解码路径组合空间。因此,它们限制了接受长度和解码效率。为利用这种多候选结构,我们将基于树的起草应用于扩散起草器,从而探索多样的候选路径。然而我们发现朴素的树形起草并非最优:扩散边际分布对前缀不敏感(prefix-blind),与基于前缀的AR验证不匹配,导致不可靠的路径排序。我们提出PRESTO,一个原则性框架,通过前缀对齐评分(PREfix-aligned Scoring)与基于优先级的树搜索(priority-based Tree search)实现扩散投机解码(diffusion speculative decOding),将基于树的起草扩展到扩散起草器,同时解决扩散草稿置信度与基于前缀的AR验证之间的根本性不匹配。PRESTO背后的关键原则是:(1)候选排序应与AR验证基于前缀的特性对齐;(2)树构建应优先考虑具有高验证潜力的候选路径,以最大化接受长度。大量实验表明,PRESTO在最先进的专用扩散起草器SD上平均实现最高1.5倍的端到端吞吐加速,在自投机扩散LLM上跨多个基准平均实现1.12倍加速。
