论文
TOPAS:多代理 LLM 服务的工作流感知前缀状态调度
TOPAS: Workflow-Aware Prefix-State Scheduling for Multi-Agent LLM Serving
摘要
前缀缓存在多代理 大语言模型 (LLM) 服务中引入了一个基本权衡:为代理保留较长的系统提示键值 (KV) 缓存可以加速未来的调用,但会减少可用于批处理并发请求的 GPU 内存。在多阶段工作流中,现有的调度程序倾向于优先考虑直接前缀位置或整体工作流进度。然而,在共享 KV 缓存预算下,单独优化任一目标都可以通过下游延迟或频繁的前缀替换来延长任务级作业完成时间 (JCT)。为了取得平衡,我们在这里提出 TOPAS,一种面向任务的前缀感知调度程序,它共同决定哪些代理前缀保留在缓存中以及哪些请求要调度执行。 TOPAS 通过权衡每个任务最长剩余服务路径的预期减少与下游前缀重用的近期收益,并考虑前缀移动和抢占的成本,对候选决策后状态进行评分。还结合了任务级老化机制来防止饥饿。我们在 SGLang 框架内实施 TOPAS,并评估其在三个合成 DAG 和两个 MetaGPT 软件开发工作流程上的性能。与每个工作负载和指标的最佳性能基线相比,TOPAS 在合成工作负载上将平均/p99 JCT 降低了 39.8%/49.4%,同时在 MetaGPT-SOP 上将平均 JCT 降低了 9.8%,在 MetaGPT-TL 上将平均/p99 JCT 降低了 22.0%/26.6%。