论文

KV 数据包:LLM 的免重新计算、上下文无关的 KV 缓存

KV Packet: Recomputation-Free Context-Independent KV Caching for LLMs

模型推理KV Cache

摘要

大语言模型 (LLM) 严重依赖键值 (KV) 缓存来最大限度地减少推理延迟。然而,标准的 KV 缓存是上下文相关的:在新的上下文中重用缓存的文档需要重新计算 KV 状态以考虑注意力分布的变化。 CacheBlend、EPIC 和 SAM-KV 等现有解决方案通过有选择地重新计算词元子集来缓解此问题;然而,它们仍然会产生不可忽略的计算开销 (FLOP) 和增加的首次词元时间 (TTFT) 延迟。在本文中,我们提出了 KV Packet,这是一种无需重新计算的缓存重用框架,它将缓存文档视为包装在轻量级可训练软词元适配器中的不可变“数据包”,这些适配器通过自监督 蒸馏 进行训练以桥接上下文不连续性。 Llama-3.1 和 Qwen2.5 上的实验表明,所提出的 KV Packet 方法比基于重新计算的基线实现了接近零的 FLOP 和更低的 TTFT,同时保留了与完全重新计算基线相当的 F1 分数。