论文

通过不确定性感知输出长度预测来调度 LLM 推理

Scheduling LLM Inference with Uncertainty-Aware Output Length Predictions

AI 基础设施推理服务

摘要

为了安排 LLM 推理,\textit{最短作业优先} (SJF) 原则是有利的,它可以优先考虑具有短输出长度的请求,以避免队头 (HOL) 阻塞。现有的方法通常为每个请求预测单个输出长度以方便调度。我们认为这样的 \textit{点估计} 与 LLM 推理的 \textit{随机} 解码过程不匹配,其中输出长度本质上是 \textit{不确定} 并由序列结束(EOS)词元采样时确定。因此,每个请求的输出长度应该符合分布而不是单个值。通过对经验数据和随机解码过程的深入分析,我们观察到输出长度遵循重尾分布,并且可以拟合 log-t 分布。在此基础上,我们提出了一个称为尾部膨胀期望(TIE)的简单指标来代替 SJF 调度中的输出长度,它通过尾部概率调整 log-t 分布的期望,以考虑请求生成长输出的风险。为了评估我们的 TIE 调度程序,我们将其与三个强大的基线进行比较,结果表明,TIE 将在线推理的每个词元延迟降低了 2.31\times$,并将离线数据生成的吞吐量提高了 1.42\times$。