论文

迈向多模型LLM调度器:卸载与抢占的实证洞见

Towards Multi-Model LLM Schedulers: Empirical Insights into Offloading and Preemption

AI 基础设施推理服务

摘要

现代大语言模型(LLM)部署日益需要在共享的异构硬件上服务多个架构、规模与专长各异的模型。这一设定为资源分配、分发与调度带来新挑战,尤其是在GPU内存受限、必须进行部分CPU-GPU卸载与抢占的情况下。现有系统主要优化单模型吞吐量,针对这些条件下多模型调度的工作相对很少。本文对不同的LLM在不同硬件平台上的行为进行了实证研究,聚焦层卸载与抢占的性能影响。我们表明,卸载会导致解码吞吐量出现强烈的非线性且依赖模型的退化,较小的模型对GPU驻留减少表现出更敏锐的敏感性。我们进一步证明,抢占带来可观的额外开销,主要由模型状态重载而非键值缓存传输主导,且该开销在不同模型与硬件平台间差异显著。此外,我们强调序列长度与互连带宽在放大数据搬运与执行低效中的作用。基于这些发现,我们识别出未来调度器必须考虑的一组关键特征,包括模型特定的卸载敏感性、负载特征以及抢占与数据传输的成本结构。这些洞见为下一代LLM服务系统的设计提供了指导,使其能够以混合CPU-GPU执行高效管理异构的多模型负载。

迈向多模型LLM调度器:卸载与抢占的实证洞见:论文配图
图1:Llama3:8B模型在不同GPU层分配比例下的吞吐量表现。