用于开放网络检索增强的风险约束新鲜度感知语义缓存 LLM
Risk-Constrained Freshness-Aware Semantic Caching for Open-Web Retrieval-Augmented LLMs
摘要
语义缓存通过为语义相似的查询提供缓存答案来减少检索增强生成(RAG)的延迟和成本,但大多数现有方法并没有对开放网络证据的时变新鲜度进行建模。我们提出了 FreshCache,一种三层语义缓存,它将缓存重用视为风险受限的时间推理问题:在批准缓存命中之前,FreshCache 使用由学习的 MLP 增强的拟合指数衰减模型来估计缓存结果过时的概率,并且仅当该概率低于答案(epsilon = 0.10)、URL 列表(epsilon = 0.20)和页面内容(epsilon = 0.35)。这允许系统随着条目老化而优雅地降级,而不是强制在陈旧命中和完整管道执行之间进行二元选择。我们引入了 FreshCache-Bench,它是跨五个新鲜度类别的 8,072 个基本查询的基准,带有 真值 陈旧标签,这些标签是从基线爬行后 1、12、24 小时和 7 天的真实 Web 快照中提取的,通过释义生成扩展到 31,201 个查询。在 24 小时评估窗口中,FreshCache_MLP 在基于哈希的过时错误为 0.1% 的情况下实现了 97% 的搜索 API 节省,并且对 396 个已确认的更改对进行的 LLM 判断评估显示,检测到的内容更改中只有 34.3% 实际上会影响答案的正确性,从而使真正影响答案的过时错误约为 0.034%。基于规则的 FreshCache 在时间保留校准下以 3.3% 的陈旧错误实现了 98% 的搜索节省,优于 SemanticTTL(14.9% 陈旧,72% 保存)、vCache(7.2% 陈旧,47% 保存)和 SCALM(5.2% 陈旧,96% 保存)。消融显示,与仅相似性重用相比,时间风险门使陈旧错误减少了 11.6 个百分点,并且学习到的 MLP 使基于规则的模型又使陈旧错误减少了 3.2 个百分点。