论文
CacheWeaver:用于高效有证据依据的RAG 推理的缓存感知证据排序
CacheWeaver: Cache-Aware Evidence Ordering for Efficient Grounded RAG Inference
摘要
检索增强生成 (RAG) 改善了事实依据,但它也延长了提示时间并提高了预填充成本。仅当请求共享相同的词元前缀时,vLLM 等服务引擎中的前缀缓存才会降低此成本。然而,在扎根生成中,相邻查询可能会以不同的顺序检索重叠证据,因此设置重叠不会成为可重用的前缀重叠。我们提出了 CacheWeaver,一种用于缓存感知证据排序的轻量级提示层方法。该方法在最近提供的证据序列上保留前缀树,并使用贪婪游走将最可重用的前缀放在第一位,同时保持服务引擎和检索的证据集不变。在三种 vLLM 配置中,相对于检索顺序前缀缓存,该方法将中值首次标记时间 (TTFT) 降低了约 20-33%,而不会损害我们 QA 测试中的答案质量。贪婪策略达到了预言机排序中 TTFT 增益中值的 97.5%,这表明大多数可重用前缀局部性可以通过检索和推理之间的简单调度层来恢复。