论文

LLM 服务中 推测解码 的可解释延迟模型

An Interpretable Latency Model for Speculative Decoding in LLM Serving

AI 基础设施推理服务

摘要

推测解码 (SD) 通过使用较小的草稿模型提出多个词元,并由较大的目标模型并行验证,从而加速 大语言模型 (LLM) 推理。虽然之前的工作证明了隔离或固定批次设置中的显着加速,但生产服务系统中 SD 的行为仍然知之甚少:请求负载随时间变化,有效的批次大小从服务系统中出现,而不是直接控制或观察。在这项工作中,我们为 LLM 服务中的 SD 开发了一个简单且可解释的延迟模型。我们使用利特尔定律从请求率推断有效批量大小,并将每个请求需求分解为与负载无关和负载相关的组件,以进行预填充、起草和验证。我们使用 vLLM 的广泛测量来验证我们的模型,包括验证者和起草者模型大小、预填充和解码长度、请求率、草稿长度和接受概率。该模型准确地描述了观察到的延迟,解释了为什么加速通常会随着服务器负载的增加而减小,并描述了草案长度、接受率和验证者-起草者大小如何在服务条件下影响延迟,并对在已部署系统中配置 SD 产生影响。我们进一步展示了该框架如何扩展到专家模型的混合,其中稀疏专家激活改变了负载状态下的有效服务成本。总之,我们的结果为理解真实 LLM 服务系统中的 SD 提供了一个结构化框架。