论文

LoopSpec:循环Transformer的流水线自推测解码

LoopSpec: Pipelined Self-Speculative Decoding for Looped Transformers

模型推理投机采样

摘要

循环 Transformer 通过跨循环深度重复应用 Transformer 块的共享堆栈,以紧凑的参数大小实现强大的性能。然而,与参数大小相当的标准 Transformer 模型相比,它们会产生更高的解码延迟,因为在每个循环深度都会访问共享权重。为了提高解码效率,自推测解码特别适合 Looped Transformer,因为它们的中间循环状态可以直接提供草稿预测,而无需辅助草稿模型。因此,我们提出了 LoopSpec,这是一种专为 Looped Transformers 量身定制的免训练自推测解码框架。 LoopSpec 从早期循环状态中提取草稿词元,并以管道方式运行,将未来词元的草稿生成与当前词元的目标验证重叠。为了在不产生过多计算开销的情况下提高草稿精度,我们从更深的循环深度引入了选择性的第二个提案,同时确保贪婪和采样机制下的无损解码。此外,我们以封闭形式导出最佳建议深度,并显示预测匹配测量。在推理和编码基准测试中,LoopSpec 在不同的 Looped Transformer 上实现了高达 6.83$\times$ 的推理加速。