论文
MVR-cache:通过多向量检索和学习提示分割优化语义缓存
MVR-cache: Optimizing Semantic Caching via Multi-Vector Retrieval and Learned Prompt Segmentation
摘要
为了降低 LLM 成本和延迟,语义缓存系统必须准确识别新提示何时与缓存提示匹配。当前的方法通常依赖于简单的相似性度量,这限制了它们的有效性。我们引入了 MVR-cache,这是一种新颖的语义缓存方法,通过集成多向量检索 (MVR) 显着提高检索准确性。 MVR-cache 基于可学习的分段模型构建,该模型可以智能地分割提示,从而通过 MaxSim 实现细粒度的相似性比较。我们从严格的理论分析中得出模型的训练目标。这可以确保优化这个目标直接在严格的正确性约束下最大化缓存命中。为了解决由此产生的不可微组合优化问题,我们利用基于强化学习的训练策略,以理论为基础的目标作为奖励。跨不同任务的既定基准的实验结果证实,与最先进的技术相比,MVR 缓存始终将缓存命中率提高了 37%,同时保持了相同的正确性保证。 MVR-cache 可在 https://github.com/PKU-SDS-lab/MVR-Cache 获取