论文
Minima-KV:以混合格式分页注意力实现保留式KV缓存压缩
Minima-KV: Retention-Preserving KV Cache Compression with Mixed-Format Paged Attention
摘要
键值(KV)缓存是长上下文LLM服务中的主要容量与带宽瓶颈。我们提出Minima-KV,一种用于混合格式分页注意力的保留式分层结构。较新且受保护的Anchor(锚点)页保留在FP8中,而较旧的非锚点页移入打包的TQ3;每个活跃请求页仍保持可寻址。特定格式的内核计算部分注意力状态,并通过全局归一化的在线softmax合并将它们组合,从而无需缓存大小的密集影子(shadow)即可实现异构直接解码。在一块96 GB NVIDIA RTX PRO 6000 Blackwell GPU上,针对相互独立、绑定配置的Qwen3.6-27B配置档案,部署核算报告每个活跃token的注意力KV为18.3 KiB,相当于相对BF16的3.50倍压缩和相对FP8的1.75倍压缩。一个完整物化的质量配置在16K RULER大海捞针任务上与其密集控制基线相当。在同样的503题LongBench v2集合上,在16K、32K和64K处测得的差值分别为-0.80、-0.60和-0.40个百分点。一项单独的单对直接解码金丝雀测试(两个59,008 token的请求)测得相对其控制基线3.625倍的活跃KV压缩和0.9821倍吞吐量,将全部16个全注意力层路由而无回退,且不保留密集影子。这些结果确立了一条实用的混合格式路径,可在不逐出活跃请求KV页的情况下压缩长上下文状态。