论文

PCR:前缀缓存服务的精确内存-时间优化

Exact Memory-Time Optimization for Prefix-Cached Language Model Serving

模型推理KV Cache

摘要

保留语言模型前缀状态是把重算成本与存储时间做权衡。独立优化每个缓存块会高估收益:驻留块只有在其所需前缀也可用时才可用。我们提出前缀证书保留(PCR),针对静态、分组、访问即重置超时的精确有限轨迹形式化:可用前缀奖励成为节点,其前提是超时阈值与前置命中证书;所得最大权闭包归约为一次最小割,图规模随块查找数与超时选择数线性。断点定理把该构造扩展到所有非负超时而无离散化误差;我们还推导对有序超时按网格规模线性的动态规划及限定该限制成本的界。小实例穷举检查与39632条公开Mooncake请求的按时间重放验证了该形式化。在固定网格上,有序超时在120个轨迹-分组-价格情形中的118个达到无限制训练最优;异构保留改善若干留出内存-时间权衡,但更细的训练优化并不一致改善迁移。贡献是一个可处理的优化模型与可审计的保留策略基准;实验度量可用前缀块与存储时间,而非GPU延迟。