论文
缩小语义缓存的操作差距
Closing the Operational Gap in Semantic Caching
摘要
语义缓存通过为语义相似的查询提供缓存响应来降低 LLM 推理成本。标准实践使用 PR-AUC 来评估这些系统,该指标仅衡量分数排名的好坏,而忽略它们是否在固定阈值下可用。我们表明这种不匹配会导致系统性的不良部署选择,因为具有最高 PR-AUC 的模型通常是运行最差的。我们引入了精度 - 缓存命中率 (P-CHR) AUC(一种缓存感知指标,用于测量跨缓存利用率级别的精度)和操作保留率 (ORR)(捕获部署时离线排名质量的存活程度)。我们将离线质量和部署质量之间的操作差距分解为可恢复的阈值效用组件和由数据集的阳性率固定的不可简化的结构组件。我们的实验表明,阈值-效用差距是由训练目标而不是数据规模决定的,并且只能通过重新规范化候选池的分数或改变训练目标来实现。最终,语义缓存的模型选择是一个阈值效用问题,而不是排名问题,测量它是缩小差距的第一步。