论文

LLMVisor:面向多租户大语言模型服务的实时延迟归因模型

LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving

AI 基础设施可观测性

摘要

随着大语言模型推理转向多租户GPU集群,协同批处理提升了吞吐量,却掩盖了每租户的使用量并限制了控制能力。要实现推理引擎的分数级共享,需要一个实时、按请求归因的原语,要求足够精确且足够轻量,能运行在调度循环内。我们提出LLMVisor,一个屋顶线(roofline)引导的延迟归因模型,通过与FLOPs和内存I/O流量成比例的特征上的简洁分段线性形式,刻画内存受限与计算受限两个阶段。LLMVisor将批延迟分解为可加的按请求份额,并以微秒级效率运行。我们在A100/H100 GPU上、不同张量并行度与工作负载组合下,针对Llama 3.1-8B和Qwen 2.5-14B/32B评估LLMVisor。相比token计数基线,LLMVisor取得接近完美的R平方,在批处理变化与序列差异下,prefill的p90和p99相对误差最多分别降低2.5倍和3.3倍,decode最多分别降低3.5倍和4.4倍。

LLMVisor:面向多租户大语言模型服务的实时延迟归因模型:论文配图
图1:现代大语言模型(LLM)推理引擎中的典型工作流可总结如下。请求到达后被排入请求缓冲队列。在每个推理步骤,调度器从队列中选择要执行的请求。LLMVisor在调度阶段运行,提供GPU时间归因,使调度器能够根据预留的GPU时间配额实施多租户公平性。请求被调度后,推理引擎将其分发到GPU,加载相应的KV缓存与模型权重以执行推理计算。