论文
HeraSys:通过细粒度端到端优化协同服务多个LLM工作流
HeraSys: Collaborative Serving of Multiple LLM Workflows via Fine-Grained End-to-End Optimization
摘要
大语言模型(LLM)的兴起使服务系统从处理孤立请求转向编排高并发的多租户智能体工作流。然而,现有方案通常优先考虑工作流内优化,在很大程度上忽视了工作流间优化的巨大潜力。本文提出HeraSys,一个旨在优化并发工作流端到端性能的LLM服务系统。通过细粒度编排,HeraSys借助结构化节点合并与复用消除跨工作流的计算冗余。此外,HeraSys引入负载感知的联合调度策略,通过评估查询间与查询内优先级来动态管理执行顺序。通过将资源倾斜机制与自适应批处理和流水线分解相结合,HeraSys在保持低平均延迟的同时有效缓解尾延迟,从而大幅提升系统吞吐量。大量实验表明,在严格延迟保证下,HeraSys将P99延迟降低至多2.17倍,并将服务吞吐量提升至多1.85倍。
