缓存感知提示压缩:LLM API 缓存的两层成本模型
Cache-Aware Prompt Compression:A Two-Tier Cost Model for LLM API Caching
摘要
生产 LLM 部署结合了两种降低成本的原语:提示缓存(重用词元前缀的折扣率)和提示压缩(发送的词元更少)。压缩文献对查询感知方法进行了标准化,这些方法为每个查询生成不同的压缩前缀,从而在每次调用时机械地使前缀严格缓存失效。我们在 Anthropic 的 Sonnet 4.6 API 上凭经验描述了这一成本,发现缓存远非文献假设的 rho=1.0 理想状态:Sonnet 的缓存具有两层架构,其阈值接近 3,500 个词元,低于该阈值,在 30 个调用会话中,命中率稳定在 rho~0.83。我们的成本模型预测并且实验证实,在现实的 rho 下,查询感知压缩在高压缩比 (r>=6) 下击败了原始缓存。我们提出了缓存感知提示压缩(CAPC),将与查询无关的压缩与显式的cache_control结合起来,加上一个层保留比率限制,防止过度压缩将缓存的前缀推入热层。 CAPC 是 LongBench-v2 上 16/16 配置中最便宜的策略,与仅缓存相比平均节省 49%,与查询感知压缩相比平均节省 64%,比普通压缩节省 90%,质量在未压缩基准的 0.05 以内。我们在三个生产工作负载上验证 CAPC:具有 94k 词元模式前缀的企业工具使用助手(r=3 时成本降低 51.7%);跨两个代码库的图形化知识图 RAG 管道(FastAPI 上的 9.3 倍与全部缓存,httpx 上的 2.4 倍);以及公共 tau 基准零售基准(50 项任务),其中 CAPC 是四种策略中最便宜的,其奖励与普通策略完全相同(均为 36/50,p=1.00),而查询感知压缩是最昂贵的,比普通策略高出 40.1%——这是交叉模型在公共基准上的负 ROI 预测的首次生产确认。