论文
PRISM:通过调度-内存协同设计快速在线 LLM 服务
PRISM: Fast Online LLM Serving via Scheduling-Memory Co-design
摘要
现代在线 大语言模型 (LLM) 服务,例如检索增强生成 (RAG) 和代理系统,越来越多地暴露出两个显着特征:提示分段(例如,系统指令、检索到的段落、工具输出)和热点倾斜,其中一小部分这些分段在用户请求中频繁重复出现。如果未能联合利用这些模式,可能会导致重复预填充热门段并延长 TTFT,从而损害吞吐量和用户感知的响应能力。然而,现有的工作独立地处理这些模式:KV 缓存管理主要利用段重用,同时调度重新排序请求以提高缓存局部性,但两者都没有将请求准入与 KV 缓存保留保持一致。为了解决这个差距,我们首先分析调度和 KV 缓存管理如何共同影响 TTFT。在此指导下,我们提出了 PRISM(前缀重用优化集成调度和内存),它共同设计了查询感知调度程序(QAS)和需求感知基数树(DART),以使请求准入与精确前缀 KV 保留保持一致。我们的评估结果表明,与最强的基线相比,PRISM 在 4B 和 13B 模型上将平均每 QPS P99 TTFT 降低了 23.3% 和 37.1%,同时将精确前缀 KV 缓存命中率分别提高了 5.9 和 12.2 个百分点。