论文

超越预测:LLM 推理的尾部感知调度

Beyond Prediction: Tail-Aware Scheduling for LLM Inference

AI 基础设施推理服务

摘要

LLM 服务表现出极大的长度可变性,使得基于大小的调度在实践中变得困难。最近的 LLM 调度程序使用预测的解码长度或等级来近似 SJF/SRPT,并主要报告以平均值为中心的指标,例如 TTFT 和 TBT。我们表明,这些预测驱动的策略在分布变化、突发到达和 GPU 内存压力下可能很脆弱,同时对主导用户体验的尾部延迟 (P90-P99) 提供有限的控制,即使具有完美的解码长度知识。我们引入了一种分布感知、无预测的调度框架,该框架用轻量级统计信号驱动的软优先级提升取代了显式长度预测。我们的设计共同优化调度和缓存感知抢占,以考虑跨工作负载混合的内存耦合解码动态。通过对生产和开源跟踪进行评估,我们的方法相对于具有完美长度知识的 SRPT,将 P99 TTLT 降低了 35-50%,并将跨工作负载(包括推理密集型和聊天密集型任务)的 TTFT 降低了 34-47%。这些结果证明了优化在线 LLM 服务中尾部延迟的强大替代方案。