论文

NanoSpec:使用极简上下文词汇加速 推测解码

NanoSpec: Accelerating Speculative Decoding using Minimalist In-Context Vocabularies

模型推理投机采样

摘要

大语言模型 的大量词汇量通常超过 100k 个标记,这给 推测解码 期间的最终线性投影层带来了计算瓶颈。现有的词汇修剪解决方案依赖于静态或粗粒度的子词汇,这需要较大的活动大小($\sim$30k)来维持草稿质量。我们提出了 NanoSpec,这是一种新颖的 无需训练 方法,它通过为每个生成步骤动态构建一个极简的、上下文感知的主动词汇表来打破这种权衡。利用语言生成固有的时间局部性,NanoSpec 实现了高覆盖率,同时将平均词汇量削减了超过 $40\times$(至 $<$3k 标记),而不需要任何辅助训练参数。为了在现代硬件上实现如此高稀疏性的理论上的好处,我们引入了一种系统算法协同设计,通过异步收集和 GPU 驻留状态管理克服了稀疏内存访问的低效率。作为补充的即插即用模块,NanoSpec 平均缩短了 51.6\% 的草稿时间,在 7 个任务中比最先进的 推测解码 方法 EAGLE-2 和 EAGLE-3 提供了 1.17$-$1.29\times$ 的端到端加速,并且性能优于基于复杂训练的修剪基线。