论文
Page-EntroKV:GQA下硬件对齐的熵加权KV驱逐
Page-EntroKV: Hardware-Aligned, Entropy-Weighted KV-Cache Eviction under Grouped-Query Attention
摘要
长上下文自回归语言模型服务受KV缓存制约。多数动态驱逐方法按查询头打token重要性分并独立选token——这与分组查询注意力(GQA)不匹配:多个查询头共享一个物理KV缓冲,逐头分歧的选择迫使服务引擎保留其并集(缓存最多膨胀组比r倍),而算术均值池化稀释承载事实召回的专用检索头。我们提出Page-EntroKV——在GQA服务实际分配的粒度上运作的KV驱逐形式化框架:每个物理组内的头以由孤立sink的碰撞(Renyi-2)熵导出的权重池化——每头一次内积、预填充时算一次、无需校准——sink头无法伪装成检索头。池化分数投影到PagedAttention页帧,驱逐在硬件元组(层,组,页)执行。我们形式化并集开销比(UOR)与组内分歧,证明二者在双头组下的精确恒等式与任意组比的双侧界,证明严格预算保持与均值池化可证违反的有限上下文针保持界,并给出精确的逐层页核算。试点架构(Qwen2.5-1.5B-Instruct,r=6)上2240次组测量的头无关重放显示:2%预算下并集开销达4.75倍,而Page-EntroKV的UOR恰为1.000;sink隔离消除13倍的sink伪装;20%预算下针召回100%对均值池化的0%;每页大小的保留基数精确;QA与代码任务在20%保留下仍可解。