论文
微调 KV 缓存串联感知模型或重新计算 KV 缓存?为什么不两者都呢?
Fine-Tuning a KV Cache Concatenation-Aware Model or Recomputing KV Caches? Why Not Both?
摘要
在检索增强生成(RAG)系统中,大量检索到的块被连接起来形成输入上下文,以便用户可以接收基于外部知识的高质量响应。因此,输入上下文长度大幅增加,导致预填充工作量更大,进而导致第一个词元 (TTFT) 的时间更长。虽然之前重用预先计算的键值 (KV) 缓存的工作有效地减少了长上下文输入的 TTFT,但仍不清楚当输入上下文变得很长时是否可以保持响应质量。在本文中,我们提出了一种组合方法,(i)在考虑 KV 缓存串联的同时微调模型,以及(ii)有选择地重新计算 KV 缓存的子集。通过应用这两种技术,我们证明了长上下文输入的准确性得到了提高。 RULER 基准测试表明,对于 124k 个词元输入,我们的方法比仅重新计算 KV 缓存的基线将 RULER 分数提高了 9.7 分。而且,TTFT相比fullattention减少了80%。