论文
EchoKV:通过基于相似性的重建实现高效的 KV 缓存压缩
EchoKV: Efficient KV Cache Compression via Similarity-Based Reconstruction
摘要
键值 (KV) 缓存不断增长的内存需求给长上下文应用程序中的 大语言模型 (LLM) 带来了重大瓶颈。现有的低秩 KV 压缩方法通过修改模型投影来减少占用空间,从而限制了在有足够内存可用时切换回标准全缓存推理的灵活性。在本文中,我们提出了 EchoKV,一种灵活的 KV 缓存压缩框架,支持从完整 KV 缓存到压缩缓存的按需转换。与传统的压缩-解压范例不同,EchoKV 利用轻量级网络从部分子集中重建丢弃的 KV 组件,利用注意力头之间内在的层间和层内相似性。我们进一步引入了轻量级两阶段 微调 策略,对于 7B 模型,在单个 A100 GPU 上只需要几分钟。 LongBench 和 RULER 上的实验结果表明,EchoKV 在多个压缩比和主干模型上始终优于现有方法,同时保留了短上下文场景中全缓存推理的吞吐量。