论文
S$^4$R:压缩长上下文 KV 缓存的选择性采样、子空间和稀疏重建
S$^4$R: Selective Sampling, Subspaces, and Sparse Reconstruction for Compressed Long-Context KV Caching
摘要
大语言模型 (LLM) 中上下文窗口长度的增长显着增强了其长上下文功能,但由于键值 (KV) 缓存而产生了过高的内存成本。尽管 KV 缓存的低秩压缩是一种很有前途的补救措施,但现有方法面临着困境:离线方法依赖于外部校准数据,而在线方法则需要大量计算来进行完全快速的分解和重建。在本文中,我们提出了 S$^4$R,它从选择性采样的 token 构建低秩子空间,并计算稀疏重建的 KV 表示的注意力。 S$^4$R 使用提示感知初始化从代表性提示子集构建初始键/值基础,权衡校准数据依赖与预填充成本。由于在每个解码步骤完全重建缓存的成本非常昂贵并且会损害吞吐量,因此我们进一步采用稀疏重建来在解码期间仅保留信息位置。使用 Llama 和 Qwen 模型系列在 LongBench 和 RULER 上进行的大量实验表明,S$^4$R 实现了高达 5$\times$ KV 压缩,并且具有接近全缓存的精度,将固定压缩的效率与提示相关方法的适应性相结合。