论文
QCFuse:经压缩视图的查询感知缓存融合用于高效RAG服务
QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving
摘要
检索增强生成 (RAG) 通过将生成基于外部证据来提高大语言模型 (LLM) 答案质量,但处理检索到的上下文使预填充阶段成为主要服务成本。 RAG 缓存融合通过为检索到的块重用预先计算的键值 (KV) 缓存并在当前提示下有选择地重新计算词元来降低此成本。然而,现有的选择器面临质量和效率之间的困境:快速查询不可知或最终层查询到上下文的选择器可能会错过与请求相关的证据,而全视图查询感知选择器在重新计算之前需要广泛的上下文和层可见性,因此会阻碍分层缓存融合管道。我们提出了 QCFuse,一个用于 RAG 缓存融合的压缩视图查询感知选择器。 QCFuse 使用块锚查询探测来调节紧凑的每块锚上的用户查询状态,并使用关键层分析来识别重新计算词元,而无需进行全层检查。我们在 SGLang 中实现 QCFuse,并在六个数据集的四个开放权重 LLM 上对其进行评估。 QCFuse 达到完全预填充级别的质量。在匹配的质量下,QCFuse 的平均预填充时间比完全预填充快 1.7 倍,比 ProphetKV(最强的质量保持基线)快 1.5 倍。
