论文

OrbitFlow:通过细粒度 KV 缓存重配置实现 SLO 感知的长上下文 LLM 服务

ORBITFLOW: SLO-Aware Long-Context LLM Serving with Fine-Grained KV Cache Reconfiguration

AI 基础设施推理服务

摘要

服务长上下文 LLM 具有挑战性,因为请求长度和批组成在 token 生成过程中不断变化,导致内存占用在运行时显著波动。将 KV 缓存卸载到主机内存会限制有效内存的使用,而现有的静态、预定卸载策略无法适应长上下文服务中快速变化的内存需求。这常导致过多的 CPU 到 GPU 的 KV 传输,进而造成延迟尖峰和频繁的 SLO 违约。为应对这些挑战,我们提出 OrbitFlow,一个细粒度、自适应的 KV 缓存管理系统,用于在长上下文 LLM 服务中满足延迟 SLO。OrbitFlow 采用轻量 ILP 求解器,在内存容量约束内为每个请求决定哪些层的 KV 缓存保留在 GPU 上。当当前方案在 token 生成过程中变得次优时,它会基于运行时反馈持续细化 KV 布局。在重负载下,OrbitFlow 会调用回退机制,临时推迟内存占用大的在途请求,以保持整体 SLO 达成率。我们的实验表明,与现有卸载方法相比,OrbitFlow 将 TPOT 和 TBT 的 SLO 达成率分别提升最高 66% 和 48%,同时将 95 分位延迟降低 38%,并实现最高 3.3 倍的吞吐提升。

OrbitFlow:通过细粒度 KV 缓存重配置实现 SLO 感知的长上下文 LLM 服务 配图
图 3:一个示意性示例,说明为什么静态、统一的卸载(offload)方法是不够的。时间线针对三种放置(placement)方案,分别追踪较早的一个解码步骤(步骤 1,左)与晚得多的一个解码步骤(步骤 16,右)。每条时间线都标注了 GPU 上驻留的 KV 块、每层预取缓冲区的大小以及由此产生的停顿。