论文
用于低成本 LLM 服务的连续语义缓存
Continuous Semantic Caching for Low-Cost LLM Serving
摘要
随着 大语言模型 (LLM) 变得越来越流行,缓存响应以便用户可以通过语义相似的查询重用它们已成为降低推理成本和延迟的重要策略。现有的缓存框架建议通过假设有限的、已知的离散查询范围并了解它们的服务成本和到达概率来决定缓存哪些查询响应。然而,随着 LLM 的用户和查询池的扩大,这样的假设变得越来越站不住脚:现实世界的 LLM 查询驻留在无限、连续的嵌入空间中。在本文中,我们为不确定性下连续查询空间中的语义 LLM 响应缓存建立了第一个严格的理论框架。为了弥合离散优化和连续表示空间之间的差距,我们引入了动态 $ε$-net 离散化和核岭回归。这种设计使系统能够正式量化估计不确定性,并概括跨连续语义查询邻域的 LLM 查询成本的部分反馈。我们开发了离线学习和在线自适应算法,并进行了优化,以减少因更改缓存响应而产生的切换成本。我们证明我们的在线算法实现了针对最佳连续预言的亚线性后悔界限,这减少了离散查询模型的现有界限。广泛的实证评估表明,我们的框架很好地近似了连续最优缓存,同时与现有方法相比还减少了计算和切换开销。