论文

双池词元预算路由,实现经济高效且可靠的 LLM 服务

Dual-Pool Token-Budget Routing for Cost-Efficient and Reliable LLM Serving

AI 基础设施推理服务

摘要

生产 vLLM 队列通常会为最坏情况下的上下文长度配置每个实例,从而导致大量 KV 缓存过度分配和并发性利用不足。实际上,80-95% 的请求都很短,但却是在针对长上下文优化的配置下提供的,浪费了 4-8$\times$ 的吞吐量并触发 OOM 崩溃、抢占和请求拒绝等可靠性问题。我们确定了这些低效率的常见根本原因:配置流量不匹配。我们提出了双池词元预算路由,这是一种轻量级调度机制,将同质队列划分为两个专用池:一个高吞吐量的短上下文池和一个高容量的长上下文池。每个请求都根据其估计的总 词元预算 进行路由,使用每个类别的字节与词元的比率进行计算,该比率是通过使用情况.prompt_tokens 反馈中的指数移动平均值在线学习的,从而消除了对标记器的需要。我们还开发了一个简单的分析模型,可以根据工作负载特征和测量的吞吐量差异来预测车队级成本节省,使从业者能够在部署之前估计收益。对 Azure LLM 推理数据集和 LMSYS-Chat-1M(在 A100 GPU 上为 Llama-3-70B 提供服务)的真实跟踪进行的评估表明,我们的方法将 GPU 小时数减少了 31-42%,相当于每年节省 286 万美元,同时将抢占率降低 5.4 倍,并将 P99 TTFT 提高 6%。 AMD MI300X 上的 Qwen3-235B-A22B 案例研究,每秒 10,000 个请求,预计每年可节省 1540 万美元。该方法仅产生 O(1) 调度开销,自动适应异构工作负载,并与 PagedAttention、连续批处理和预填充解码分解等现有优化无缝组合。