论文
LLMVisor:面向多租户大语言模型服务的实时延迟归因模型
LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving
摘要
随着大语言模型推理转向多租户GPU集群,协同批处理提升了吞吐量,却掩盖了每租户的使用量并限制了控制能力。要实现推理引擎的分数级共享,需要一个实时、按请求归因的原语,要求足够精确且足够轻量,能运行在调度循环内。我们提出LLMVisor,一个屋顶线(roofline)引导的延迟归因模型,通过与FLOPs和内存I/O流量成比例的特征上的简洁分段线性形式,刻画内存受限与计算受限两个阶段。LLMVisor将批延迟分解为可加的按请求份额,并以微秒级效率运行。我们在A100/H100 GPU上、不同张量并行度与工作负载组合下,针对Llama 3.1-8B和Qwen 2.5-14B/32B评估LLMVisor。相比token计数基线,LLMVisor取得接近完美的R平方,在批处理变化与序列差异下,prefill的p90和p99相对误差最多分别降低2.5倍和3.3倍,decode最多分别降低3.5倍和4.4倍。
