论文
QV-PIC:查询感知视觉位置独立缓存,实现高效 RAG 服务
QV-PIC: Query-Aware Visual Position-Independent Caching for Efficient RAG Serving
摘要
检索增强生成(RAG)在查询中重复预填充相同的文本块,从而产生冗余计算。位置无关缓存 (PIC) 通过跨位置重复使用预先计算的键值 (KV) 来缓解这一问题,但其效率受到大量文本标记的限制。将文本块渲染为图像可以将文本压缩为更少的视觉标记,但渲染图像 PIC 的质量下降比文本 PIC 更严重。这种特定于表示的差距主要源于独立编译的缓存之间的上下文不匹配以及视觉压缩期间细粒度文本证据的丢失。现有的PIC修复方法主要通过选择性重新计算来解决前者,但它们需要在线计算并且无法恢复丢失的文本细节。我们提出了 QV-PIC,一种由模型本机模板引导的查询感知双分辨率 PIC 重用框架。离线时,QV-PIC 在模型的本机聊天模板前缀下编译视觉缓存,从而提高 PIC 质量,而无需在线重新计算。在网上,它以低分辨率保留全局上下文,并通过累积查询相关性分数在高分辨率预算内恢复细粒度文本证据,保留视觉压缩的效率优势。在六项任务中,QV-PIC 比普通渲染图像 PIC 平均 F1 提高了 21.6 个点,缩小了与普通文本 PIC 的差距,比优化文本 PIC 提高了 2.58 F1,同时将 TTFT 降低了 17.2%。相对于完全预填充,TTFT 减少了 83.8%。