论文
覆盖驱动的 KV 缓存驱逐可实现 LLM 的高效和改进推理
Coverage-Driven KV Cache Eviction for Efficient and Improved Inference of LLM
摘要
大语言模型 (LLM) 凭借处理长上下文输入的能力,擅长回答问题和总结等复杂任务。然而,部署 LLM 的成本很高,不仅因为自注意力和自回归生成的二次复杂度的高计算需求,而且因为在推理过程中存储键值 (KV) 缓存需要大量的内存开销。为了降低内存成本,现有的 KV 缓存驱逐策略利用注意力的稀疏性来选择性地存储词元的子集。在减少内存占用的同时,此类方法的性能显着下降,尤其是在需要长上下文推理的任务中。我们发现性能下降与唯一词元覆盖范围的减少有关。此外,我们从理论上表明,覆盖范围的减少限制了输入和输出之间的相互信息,从而损害了预测的准确性。为此,我们引入了 K-VEC,这是一种新颖的覆盖感知 KV 缓存驱逐策略,该策略优先考虑词元覆盖率,同时驱逐缓存中的词元。 K-VEC 引入了交叉头和跨层覆盖模块,以增强跨注意力头和模型层的词元保留,从而减轻由于低覆盖率导致的性能下降。在 16 个 LongBench 子集上进行评估,在相同驱逐率和内存约束下,K-VEC 比现有方法表现出高达 10.35 分的改进。综合评估验证了我们方法的有效性,并证明了其在资源有限的环境中高效部署 LLM 的潜力。