论文
FinCacheServe:依赖一致的答案重用,通过可变企业文档实现经济高效的 RAG 服务
FinCacheServe: Dependency-Consistent Answer Reuse for Cost-Efficient RAG Serving over Mutable Enterprise Documents
摘要
针对可变企业文档的检索增强生成服务重复执行语义等效的分析请求。答案重用可以消除受 GPU 限制的生成工作,但当文件、证据块和工具输出发生变化时,响应缓存需要依赖一致性。 FinCacheServe 将每个生成的答案视为由企业意图索引并由文档版本、证据指纹、工具指纹、模型身份和解码配置保护的服务对象。 vLLM 实施使用 Qwen2.5 模型评估 SEC 派生的财务文档工作负载。在托管 2,230 个请求的 7B 跟踪中,FinCacheServe 跳过了 53.27% 的 LLM 调用,观察到的依赖陈旧输出为零。在三个托管的 32B 操作套件种子中,它跳过了 544 个请求中的 53.31%,相比之下,版本化语义缓存为 38.97%,基于证据对齐的复用为 22.43%。容量、后端和 SLO 回放显示了 Oracle 限制的缓存管理、100k 条目事务元数据行为,以及与版本化语义缓存相比,每个依赖项新 2s-SLO 成功的估计 Wh 降低了 44.30%。