论文

截止日期感知自适应预填充分块,实现高效 大语言模型 服务

Deadline-Aware Adaptive Prefill Chunking for Efficient Large Language Model Serving

AI 基础设施推理服务

摘要

连续批处理提高了 大语言模型 (LLM) 服务吞吐量,但长提示预填充可能会延迟解码迭代并违反词元间延迟目标。分块预填充可以减轻这种干扰,但其块大小通常是固定的:小块可以保护解码延迟,但会重复支付启动开销,而大块可以提高预填充效率,但会产生延迟峰值。我们引入了 SLOWeave,一种在线调度方法,它选择预计在最早的活动解码截止日期之前完成的最大预填充块。该决策不需要特定于工作负载的块大小调整,并且是通过单调迭代成本模型上的对数时间搜索来计算的。我们证明,只要仅解码迭代可行并且成本预测器准确,SLOWeave 就会在保留每个活动请求的下一个词元截止日期的决策之间最大化立即预填充进度。我们在可重现的事件驱动模拟器和迭代级 GPU 运行时中跨聊天、混合上下文、长上下文和突发工作负载评估该方法。在每个输出词元 25 毫秒时间的目标下,SLOWeave 将混合请求的吞吐量比最强的固定块基线提高了 39%,将长上下文请求的吞吐量提高了 38%。在更严格的 10 毫秒目标下,增益分别升至 3.3$\times$ 和 2.4$\times$。这些结果将自适应块大小调整作为有用的服务原语,并提供一个可实现的控制器,用于与迭代级 LLM 运行时集成。