论文
Goose:无需训练 推测解码 的各向异性推测树
Goose: Anisotropic Speculation Trees for Training-Free Speculative Decoding
摘要
推测解码 通过起草多个候选词元并在一次前向传递中验证它们来加速 大语言模型 推理。候选者被组织为树:更深的树每一步接受更多的词元,但增加深度需要在固定的验证预算下牺牲广度(后备选项)。现有的 无需训练 方法从单个词元源起草并塑造其树,而不区分不同来源的候选质量。我们观察到两个常见的 无需训练 词元源——从输入上下文复制的 n-gram 匹配,以及来自先前前向传递的统计预测——在接受率方面存在巨大差异(约 6 倍中值差距,五个模型和五个基准的范围为 2-18 倍)。我们证明,当存在这样的质量差距时,最优的树是各向异性的(不对称的):可靠的词元应该形成深链,而不可靠的词元作为宽分支传播,从而提高平衡树的深度上限。我们在 GOOSE 中实现了这种结构,GOOSE 是一个 无需训练 框架,它构建了一个自适应脊椎树:一条高接受度上下文匹配词元的深链,在每个节点都有低接受度替代品的宽分支。所得到的树可以证明每步至少接受与单独的源一样多的词元。在五个 LLM (7B-33B) 和五个基准测试中,GOOSE 实现了 1.9-4.3 倍的无损加速,在相同预算下比平衡树基线高出 12-33%。