论文

VestigeKV:NoPE-MLA KV 缓存在残留分支中携带自己的稀疏注意力信号

VestigeKV: The NoPE-MLA KV Cache Carries Its Own Sparse-Attention Signal in a Vestigial Branch

模型推理KV Cache

摘要

长期存在的 KV 缓存必须在读取它的查询存在之前进行压缩。通过观察到的注意力进行的选择在那里崩溃:在 NoPE-MLA 模型上,H2O 和 SnapKV 在 8 倍压缩下检索 0.00 和 0.33 针,因为尚未观察到词元的重要性。相反,VestigeKV 从缓存已经携带的信号中导出稀疏注意力模式,占据稀疏注意力文献的一个未占用象限:无需训练 并且与查询无关。在 NoPE-MLA 中,64 维解耦分支是 RoPE 的残余,训练将其重新调整为显着通道;读取每行的 11% 后,它将缓存划分为一个有人值守的层和一个驻留在 GPU 的存档,任何行都不会离开,每一步都可以通过经过认证的查询自适应触发器进行访问。没有进行任何训练,缓存行也从未量化,因此每个质量效果都归因于选择和调度。在 Kimi Linear 48B 上,从 8k 到 65k 上下文,检索在 8x 下保持在 1.00,在 32x 下保持在 0.96,与全行选择的间隙为零,并且召回层在 1.00 (8k) 时保持 128x。这两层都保留在 GPU 上,因此获胜的是速度,而不是内存:每步扫描读取密集注意力的大约 26% 的字节,并且在双节点 sglang 部署中,交叉位于大约 40k 上下文中,在 256k 时达到 1.18 倍,在 496k 时达到 1.39 倍。该机制是 NoPE 独有的:RoPE MLA 上的相同运算符崩溃到 0.08,仅在没有旋转的情况下才存在与查询无关的显着性,并且在 RoPE 下证明查询通用精确合并是不可能的。所有阈值在数据之前都被冻结;该文件附有 20 条存档判决和 8 条封闭路线。