论文

SEED:通过隐式编码器-解码器进行自推测解码

SEED: Self-Speculative Decoding via Implicit Encoder-Decoder

模型推理投机采样

摘要

自推测解码通过从目标模型本身起草词元来加速大语言模型 (LLM) 推理,但面临着草案质量和成本之间的尖锐权衡。早期退出方法通过终止中间层的计算来廉价地生成草稿,但放弃了后面层提供的更深层次的表示,因此会受到草稿质量的影响。多词元预测通过从模型的最终隐藏状态发出来保持草稿质量,但需要支付完整的前向传递以在每个起草步骤中生成这些状态。我们提出了自推测编码器-解码器(SEED),这是一种自推测方法,通过重用在验证过程中已经计算出的深层上下文表示来廉价地获得高质量的草稿。我们将标准的仅解码器Transformer重新解释为隐式编码器-解码器:第一层(编码器)构建深层上下文表示,最后几层(解码器)从中发出词元。编码和验证合并为一个步骤:验证由完整的编码器-解码器执行,并且已验证前缀的上下文表示被缓存以供在起草期间重用。因此,起草速度非常快:在验证之间,轻量级解码器自回归地起草多个词元,每个词元都以缓存的表示和先前的草稿为条件。跨多个基准测试的实验表明,SEED 在 4B 规模模型上实现了高达 2.7$\times$ 的平均加速,优于提前退出和 MTP 式自推测基线,并且比最先进的 EAGLE-3 运行速度快 28%,同时保持甚至提高了标准自回归微调的生成质量。代码可在 https://github.com/lhk2004/SEED. 获取