论文
TreeFlash:并行 AR 逼近更快 推测解码
TreeFlash: Parallel AR-Approximation for Faster Speculative Decoding
摘要
推测解码 的一次性块起草器在一次前向传递中生成完整草案,通过消除顺序词元生成来实现强大的吞吐量。然而,他们预测每个草案标记仅以前缀上下文为条件,而不依赖于先前起草的标记。随着拔模深度的增加,这种非自回归条件导致绘图者的分布与验证者的真实自回归分布发生偏离。这个问题在基于树的绘图中变得更加严重,其中不同的分支被迫为后续标记共享相同的边际分布。我们提出了 TreeFlash,它通过合并一个以绘图者的隐藏状态和先前标记为条件的 MLP 层来解决这个问题,以近似自回归分布。 TreeFlash 通过采用两阶段近似机制,保留了一次性绘图器的 $\mathcal{O}(1)$ 解码时间复杂度。 TreeFlash 在各种任务和模型中实现了最先进的性能,比边缘树起草提高了 $12\%$ 的块效率和 $9\%$ 的加速。