论文

GrowPage:按需分配KV预算,实现高效大语言模型推理服务

GrowPage: On-Demand KV Budgeting for Efficient LLM Reasoning Serving

模型推理KV Cache

摘要

长输出推理使键值 (KV) 缓存成为高效 LLM 服务的关键内存瓶颈。现有的 KV 压缩方法通常依赖于预定义的每个请求预算,并且仅调整保留的 KV 状态,从而在整个解码过程中保持总容量固定。然而,推理工作负载表现出巨大的需求变化:不同的请求需要不同的 KV 容量,并且单个请求的注意力需求在生成过程中不断变化。我们引入了 \textbf{GrowPage},一个按需 KV 预算框架,它将 KV 容量视为运行时资源。 GrowPage 维护轻量级双时间尺度查询摘要以捕获最近和长期的注意力行为,并使用它们的相对注意力工作集来估计需求演变。在每个容量边界,GrowPage 要么压缩当前分配内的 KV 状态,要么在出现更广泛的需求时获取额外的物理页。通过与 PagedAttention 的页面级内存抽象集成,GrowPage 保留了连续批处理和前缀缓存。跨多个模型的推理基准实验表明,GrowPage 实现了优于现有方法的卓越性能——吞吐量权衡。

GrowPage:按需分配KV预算,实现高效大语言模型推理服务:论文配图
图1:对大型语文模式推理的科索沃志愿人员预算编制战略进行示例比较。(a) 固定预算的Zipage和按需增长计划,以满足低需求量和高需求量的要求。(b) 解释AMC23与Quen3-8B的性能和产出。