Windowed-MTP:取消百万词元上下文中的全上下文 草稿模型KV缓存开销
Windowed-MTP: Removing the Full-Context Draft-KV Tax at Million-Token Context
摘要
推测解码 通过目标并行验证的廉价草稿提议词元来加速自回归生成。前沿模型越来越多地提供内置的多词元预测 (MTP/NEXTN) 草稿预测头,前提是草案的成本可以忽略不计。在百万个词元的上下文中,这种情况会出现问题:MTP 草稿预测头 通常会在每个草稿步骤中对整个 KV 缓存进行全面关注,因此其读取会随着上下文线性增长,并主导草稿成本——这正是推测最有价值的地方。这种效果与草稿长度相结合(深度的原生草稿可能会变成净负值,比没有推测要慢),并在混合/线性注意力目标下变得锐利,在这种情况下,更便宜的验证会使草稿的全注意力阅读暴露出来。我们将 StreamingLLM 风格的滑动窗口加上注意力接收器仅应用于草稿的注意力(Windowed-MTP),保持完整的注意力验证完好无损。它是 无需训练,直接插入,并且构造无损:全注意力目标仍然决定每个接受的词元,因此窗口仅更改提议的词元,而不会更改接受的词元。它将草案的 KV 工作集限制为一个常数,在 1M 时减少约 99% 的 KV 条目。在 SGLang 中单个 GPU 上的 1M 上下文中,在三个架构系列(Qwen GDN-MoE 35B/122B 和 Mamba2 混合 NoPE 120B)中,窗口化将每个解码步骤的成本比交付的原生 MTP 草案降低了 +28% 至 +44%,输入不变的余量会随着上下文而扩大。由于每个词元的延迟是该成本除以接受长度,因此在匹配的接受情况下,端到端解码延迟会改善相同的量,并且在开窗也提高接受度的情况下会改善更多,同时保留目标的已验证输出分布。最后,未读的草稿 KV(1M 总 KV 的 7.7-11%)通过紧凑的环形缓冲区回收,无需接受或质量成本。