论文
具有 KV 缓存内存约束的 LLM 推理稳定性分析的排队理论框架
A Queueing-Theoretic Framework for Stability Analysis of LLM Inference with KV Cache Memory Constraints
摘要
大语言模型 (LLM) 的快速采用给大规模高效推理带来了重大挑战。与传统工作负载不同,LLM 推理受到计算和键值 (KV) 缓存的内存开销的限制,这会加速解码,但会很快耗尽 GPU 内存。在本文中,我们介绍了第一个队列理论框架,该框架明确地将计算和 GPU 内存约束纳入 LLM 推理的分析中。基于此框架,我们得出严格的稳定性和不稳定条件,以确定 LLM 推理服务是否可以在没有无限队列增长的情况下维持传入需求。这一结果为系统部署提供了强大的工具,有可能解决 GPU 配置的核心挑战。通过将估计的请求到达率与我们得出的稳定服务率相结合,运营商可以计算必要的集群大小,以避免代价高昂的过度购买和违反性能的供应不足。我们通过在真实 GPU 生产环境中进行大量实验进一步验证了我们的理论预测。我们的结果表明,预测的稳定性条件非常准确,偏差通常在 10% 以内。