论文
SlimSpec:用于加速 推测解码 的低秩草案 LM 头
SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding
摘要
推测解码 通过两步过程加速 大语言模型 (LLM) 中的自回归生成,其中轻量级草案模型提出词元,然后目标模型在单个前向传递中验证这些词元。尽管绘图器网络在现代架构中很小,但其 LM 头仍然可以对大词汇量进行投影,成为主要的计算瓶颈之一。在之前的工作中,这个问题主要通过静态或动态词汇截断来解决。然而,为了缓解瓶颈,这些方法带来了额外的复杂性,例如特殊的词汇管理、复杂的推理时间逻辑或训练设置的修改。在本文中,我们提出了 SlimSpec,这是绘图者 LM-head 的低秩参数化,它压缩内部表示而不是输出,从而保留完整的词汇支持。我们使用 EAGLE-3 起草器在三个目标模型和延迟和吞吐量限制推理机制中的不同基准上评估我们的方法。 SlimSpec 比标准 LM-head 架构实现了 $4\text{-}5\times$ 加速,同时保持了有竞争力的接受长度,超越现有方法高达 $8\text{-}9\%$ 的端到端加速。我们的方法需要对训练和推理管道进行最少的调整。与上述加速改进相结合,它使 SlimSpec 成为各种草稿 LM 头架构的强大替代方案。