论文

强大的草稿需要紧凑的内存:具有压缩 KV 缓存的长上下文 推测解码

Strong Drafts Need Compact Memories: Long-Context Speculative Decoding with Compressed KV Cache

模型推理KV Cache

摘要

长上下文 LLM 应用程序(例如文档摘要和多轮代理)需要从跨越数万个词元的前缀生成,这使得解码延迟成为主要瓶颈。 推测解码 (SD) 在不改变模型输出的情况下减少了延迟,但其加速取决于接受的草稿词元和草稿步骤延迟:轻量级草稿速度很快,但缺乏捕获远程依赖关系的能力,而强大的独立草稿恢复了接受,但在长前缀下会导致不断增长的 KV 访问成本。我们为长上下文 SD 引入了内存增强绘图,为强大的独立草稿配备了压缩的草稿侧 KV 内存:一个轻量级适配器构建并增量更新此内存,以保留遥远的信息和准确的近期上下文。目标验证者保留其完整的KV缓存并应用标准接受/拒绝规则,保留SD的无损保证。在前缀长度高达 32K 的 Llama~3.1-8B 和 70B 目标上进行的实验表明,我们的方法将草稿侧内存减少了 70% 以上。与自回归解码相比,它分别实现了高达 2.08 倍和 3.33 倍的加速。