论文

浅预填充、深解码:经层级非对称KV可见性的高效长上下文推理

Shallow Prefill, Deep Decoding: Efficient Long-Context Inference via Layer-Asymmetric KV Visibility

模型推理KV Cache

摘要

仅解码器语言模型中的长上下文推理成本高昂,因为在预填充期间处理长提示,在每一层缓存,并在自回归解码期间重复处理。我们引入了 \emph{Shallow Prefill, dEEp Decode} (SPEED),这是一种相位不对称 KV 可见性策略,仅在较低层中实现非锚定提示令牌 KV 状态,同时保持解码阶段令牌全深度。与以前使上层提示 KV 状态存储或构建成本更低的方法不同,SPEED 完全从上层解码可见性集中删除了预填充令牌。通过最小的 BoS 锚点,这一简单的更改保留了广泛的基准质量,同时降低了长上下文成本。在一项受控的 Llama-3.1-8B 指令调优研究中,仅使用 75\% 层进行预填充标记的 SPEED 在 OLMES 风格基准测试中达到了 51.2 的平均得分,而全深度基线的平均得分为 51.4,同时在 128K 上下文中将 TTFT 提高了 33\%,TPOT 提高了 22\%,并将活动 KV 内存减少了 25.0\%。逐层诊断表明,这种截止保留了全深度模型的主要提示选择和表示稳定区域。这些结果表明,当解码阶段令牌保持全深度时,长上下文提示令牌不需要始终保留为全深度 KV 缓存对象。

浅预填充、深解码:经层级非对称KV可见性的高效长上下文推理:论文配图
图 1:SPEED 的概述和注意力行为。左 (a):Full-Attn(上)和 SPEED-24+BoS(下)的解码时注意力质量热图,表明在去除上层预填充令牌 KV 状态后,SPEED 在很大程度上保留了全深度模型的结构化注意力模式。右 (b):SPEED 仅通过第一个 KK 层处理预填充令牌,保持解码令牌全深度,并使用现有的 BoS 令牌作为稳定锚点。