论文
浅预填充、深解码:经层级非对称KV可见性的高效长上下文推理
Shallow Prefill, Deep Decoding: Efficient Long-Context Inference via Layer-Asymmetric KV Visibility
摘要
仅解码器语言模型中的长上下文推理成本高昂,因为在预填充期间处理长提示,在每一层缓存,并在自回归解码期间重复处理。我们引入了 \emph{Shallow Prefill, dEEp Decode} (SPEED),这是一种相位不对称 KV 可见性策略,仅在较低层中实现非锚定提示令牌 KV 状态,同时保持解码阶段令牌全深度。与以前使上层提示 KV 状态存储或构建成本更低的方法不同,SPEED 完全从上层解码可见性集中删除了预填充令牌。通过最小的 BoS 锚点,这一简单的更改保留了广泛的基准质量,同时降低了长上下文成本。在一项受控的 Llama-3.1-8B 指令调优研究中,仅使用 75\% 层进行预填充标记的 SPEED 在 OLMES 风格基准测试中达到了 51.2 的平均得分,而全深度基线的平均得分为 51.4,同时在 128K 上下文中将 TTFT 提高了 33\%,TPOT 提高了 22\%,并将活动 KV 内存减少了 25.0\%。逐层诊断表明,这种截止保留了全深度模型的主要提示选择和表示稳定区域。这些结果表明,当解码阶段令牌保持全深度时,长上下文提示令牌不需要始终保留为全深度 KV 缓存对象。
