论文
EpiKV:无需注意矩阵的 Epiphany 感知 KV 缓存驱逐
EpiKV: Epiphany-Aware KV Cache Eviction Without the Attention Matrix
摘要
推理模型可以生成数万个词元长的思想链,这使得保存它们的键值 (KV) 缓存成为推理吞吐量的主要瓶颈。现有的长推理跟踪驱逐策略通常使用注意力权重对缓存的词元进行排名,需要访问注意力矩阵并使它们与快速推理内核不兼容。在这项工作中,我们研究了在紧张的缓存预算下此类策略的限制。令人惊讶的是,我们发现,在他们中最强大的人的领导下,最后几代人在没有被驱逐的情况下经常犯错;大部分准确性损失来自进入循环并运行直到长度限制的世代,并且根据固定重要性分数保留更多标记会加剧这种行为。停止循环的方法是保留模型最近查询指向的标记,并且模型已经运行的前向传递会在没有注意矩阵的情况下显示它们。受这一观察的启发,我们引入了顿悟感知 KV 缓存驱逐 EpiKV,它将隐藏状态转换与模型最近的查询相结合——在不具体化注意力矩阵的情况下对缓存词元进行排名的关键相关性。在多个基准测试中,EpiKV 匹配或优于最强的基于注意力的驱逐基线,同时使用未修改的注意力内核直接在 vLLM 中运行。