论文
LaCache:为LLM服务构建更稳健的语义缓存
LaCache: Robust Semantic Caching for LLM Serving
摘要
语义缓存,通过其嵌入表示的相似请求来重用响应,已在LLM服务中得到广泛采用,提供更快的响应时间和更低的成本。然而,现有的方案在很大程度上对缓存碰撞攻击(其中攻击者通过注入精心构造的查询来污染缓存,从而破坏后续合法请求的响应)非常脆弱。我们提出了LaCache,这是一种新颖的语义缓存方案,通过概念化且原则性的重新设计来解决这一漏洞。关键洞察是,尽管攻击者完全控制着对抗性查询,但其响应却远不如其控制程度,必须同时满足多个语义约束。与仅检查查询的缓存命中不同,LaCache还检查其第一个k个(假设性地)解码词元的缓存命中。这种设计产生了两个具体的益处。首先,它提供了形式上保证的缓存碰撞攻击的抗性:我们证明,无法构造同时引发恶意响应并导致缓存碰撞的对抗性查询。其次,增强索引提供了额外的语义上下文,从而改善了缓存检索的响应相关性。在不同LLM和基准测试中,LaCache的性能验证结果验证了其安全保证和效率提升,指向了稳健语义缓存的一个有希望的方向。
