论文
用于改进基于逐出的 KV 缓存压缩的简单插件
A Simple Plug-in for Improving Eviction-Based KV Cache Compression
摘要
KV 缓存增长是 大语言模型 中长上下文推理的主要瓶颈。现有的方法通常以二进制驱逐或表示近似为主,这可能没有充分利用对精确保留并不重要但仍然可重构的词元。我们推出了 VECTOR,这是一种基于驱逐的管道的即插即用增强功能,它引入了三向词元路由:保留、近似和驱逐。 VECTOR 将来自基本评分器的重要性信号与来自离线校准的基于回归的值估计的可重构性信号相结合。通过利用可重构性,VECTOR 恢复了有用的价值信息,否则这些信息将在二进制驱逐下不可逆转地丢失,同时保留关键向量以实现注意力路由的稳定性。实验结果表明,VECTOR 在中高压缩下改善了质量与内存的权衡,在更严格的预算制度下效果尤其明显。