论文

分形 KV 缓存档案:无损符号存储和就地检索用于长上下文 LLM 推理

Fractal KV-Cache Archives: Lossless Symbolic Storage with In-Place Retrieval for Long-Context LLM Inference

模型推理KV Cache

摘要

键值 (KV) 缓存在长上下文自回归推理的内存成本中占据主导地位,并且越来越多的工作通过量化、逐出或卸载来压缩它。我们研究一个补充问题:一旦位置的 KV 状态被量化为码本索引,结果符号流应该如何存储,存储层除了存储之外还能做更多的事情吗?重新审视了一系列收缩迭代映射代码,这些代码将符号序列序列化为低维实数向量序列,结果表明它们形成了具有以下特征的量化 KV 缓存的自然存档格式。该方法准确地提供了不断增长的缓存所需的访问模式。它是无损的,以线性时间运行,并支持 O(1) 随机访问和 O(1) 摊销追加。在具有 1024 个词元上下文的 GPT-2 上对提供该存档的量化器进行了对照研究。保持一个小的精确窗口(4个注意力池加上32个最近的词元)并归档其余的,每头残差矢量量化相对于fp16缓存减少了36-54倍的归档缓存,困惑度成本为11-15%,并且我们量化了尖锐的键/值不对称性——量化键比量化值的破坏性大约是量化值的4倍,与之前的低位KV工作一致——并使用它来分配位混合方案。最后,我们表明存档同时是一个搜索索引:近似子字符串查询直接在存储的向量上执行,并且从匹配的向量中解码匹配的上下文,而无需具体化周围的文本。我们进一步描述了档案的操作范围:截断存储点会产生一个有损机制,我们对其失真进行定位,对映射进行概率加权可以恢复算术编码,从而暴露出速率效率、随机访问和内存之间的权衡。我们发布所有代码;每个数字都会在笔记本电脑的 CPU 上重现。