论文
OrbitFlow:通过细粒度 KV 缓存重配置实现 SLO 感知的长上下文 LLM 服务
ORBITFLOW: SLO-Aware Long-Context LLM Serving with Fine-Grained KV Cache Reconfiguration
摘要
服务长上下文 LLM 具有挑战性,因为请求长度和批组成在 token 生成过程中不断变化,导致内存占用在运行时显著波动。将 KV 缓存卸载到主机内存会限制有效内存的使用,而现有的静态、预定卸载策略无法适应长上下文服务中快速变化的内存需求。这常导致过多的 CPU 到 GPU 的 KV 传输,进而造成延迟尖峰和频繁的 SLO 违约。为应对这些挑战,我们提出 OrbitFlow,一个细粒度、自适应的 KV 缓存管理系统,用于在长上下文 LLM 服务中满足延迟 SLO。OrbitFlow 采用轻量 ILP 求解器,在内存容量约束内为每个请求决定哪些层的 KV 缓存保留在 GPU 上。当当前方案在 token 生成过程中变得次优时,它会基于运行时反馈持续细化 KV 布局。在重负载下,OrbitFlow 会调用回退机制,临时推迟内存占用大的在途请求,以保持整体 SLO 达成率。我们的实验表明,与现有卸载方法相比,OrbitFlow 将 TPOT 和 TBT 的 SLO 达成率分别提升最高 66% 和 48%,同时将 95 分位延迟降低 38%,并实现最高 3.3 倍的吞吐提升。
