论文

用于 LLM 推理的流控制调度,具有可证明的稳定性保证

Flow-Controlled Scheduling for LLM Inference with Provable Stability Guarantees

AI 基础设施推理服务

摘要

大语言模型 (LLM) 因其在广泛应用中的出色性能而被广泛采用。 ChatGPT 和 Gemini 现在为数亿活跃用户提供服务,每天处理数十亿个用户请求,这使得优化 LLM 推理成为人们关注的焦点。 LLM 推理中的一个关键挑战是解码长度未知。每个请求的内存使用量随着生成的词元而增长,这可能会导致溢出并导致系统不稳定。为了解决这个问题,我们提出了一个简单的流量控制框架,用于控制提示加入活动集的速率。我们推导出任何稳定系统必须满足的必要条件,并建立了我们的算法可证明实现稳定性的充分条件。实验表明,与实践中常用的策略相比,我们的方法实现了更高的词元和请求吞吐量、更低的平均和尾部延迟以及更稳定的 KV 缓存利用率。