论文
Pythia:利用工作流可预测性实现高效的代理本机 LLM 服务
Pythia: Exploiting Workflow Predictability for Efficient Agent-Native LLM Serving
摘要
随着 LLM 应用程序变得越来越复杂,开发人员越来越多地采用多代理架构将工作流程分解为专门的协作组件,引入约束代理行为并公开有用的语义可预测性的结构。与在高度动态和不确定的条件下运行的传统 LLM 服务不同,这种结构化拓扑有机会减少运行时的不确定性$\unicode{x2015}$,但现有系统无法利用它,将代理工作负载视为通用流量并导致效率显着低下。我们对代理服务平台和内部编码助手的生产跟踪进行的分析揭示了关键瓶颈,包括前缀缓存命中率低、长上下文请求造成的严重资源争用以及由于次优扩展而导致的严重排队延迟。为了应对这些挑战,我们提出了 Pythia,这是一个多代理服务系统,它通过服务层的简单界面捕获工作流语义,释放新的优化机会,并在最先进的基线上大幅提高吞吐量和作业完成时间。