论文
VarRate:无需训练 用于长上下文 LLM 的可变速率 KV 缓存压缩
VarRate: Training-Free Variable-Rate KV Cache Compression for Long-Context LLMs
摘要
键值 (KV) 缓存是长上下文 大语言模型 (LLM) 推理中的主要内存瓶颈。两个领先的 无需训练 系列在结构上都受到限制:词元选择方法(SnapKV、Ada-KV)从观察窗口对重要性进行评分并驱逐低分词元,但驱逐是不可逆的 - 因此,当重要性信号在与查询无关的重用下下降时,准确性会下降 11-15 个点;统一的低秩编码保留每个词元,但在任何地方都花费相同的等级,浪费预算。我们观察到,这两种失败都有一个共同的解决办法:应该分配军衔,而不是驱逐军衔。我们提出了 VarRate,一种 无需训练 KV 编解码器,它通过查询显着性为每个词元分配一个可变的低秩预算,使每个词元保持非零等级。类似的自适应排名编解码器只能通过训练才能达到此分配; VarRate 不需要。由于没有丢弃词元,因此查询感知选择崩溃时,它仅降低 3.5-5.5 个点。在 LongBench(16 个任务)上匹配 20% 预算时,VarRate 在 Llama-3.1-8B 和 Qwen2.5-7B 上与未压缩模型的差距保持在 0.8 个点以内。综合两者的平均值,它是最强的匹配内存压缩器。它在两种模型上都显着优于均匀等级消融。与 KVzip(一种专门为与查询无关的重用而构建的方法)相比,它在四种设置中的三种和总体上在一个点内的准确性相当,大约是预填充开销的八分之一。