论文

FineServe:全球LLM服务工作负载的细粒度数据集与刻画

FineServe: A Fine-Grained Dataset and Characterization of Global LLM Serving Workloads

AI 基础设施推理服务

摘要

大语言模型(LLM)日益作为常开在线服务部署,使高效LLM服务成为关键系统挑战。在波动需求下实现低延迟高吞吐,需要深入理解真实服务工作负载;但现有研究常依赖代理轨迹或粗粒度刻画,无法捕捉现代多模型LLM平台的异质性。我们提出FineServe,一个从全球商业市场收集的真实多模型LLM服务工作负载数据集,支持跨异构模型与任务的细粒度服务动态刻画。利用FineServe,我们对到达动态与token行为做全面分析,揭示跨模型架构、规模与任务意图的根本不同的波动regime。基于这些洞见,我们开发FineServe工作负载生成器:把细粒度、模型感知的工作负载组合为可配置混合,为多模型服务平台基准测试量身定制。通过暴露这些细粒度工作负载动态,FineServe为评估LLM服务系统中的路由、调度与容量规划策略提供现实基础。FineServe见https://github.com/hihiztc1/FineServe。

FineServe:全球LLM服务工作负载的细粒度数据集与刻画:论文配图
图 11. FineServe 框架概述。每个模型的请求流被混合以产生统一的多模型工作负载基准。灰色表示任务感知负载适应是可选的,允许 FineServe 自然退化为一般​​任务负载模拟。