论文

LLM服务的一年纵览:负载演化、缓存与负载均衡

A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing

模型评测基准与评测资源

摘要

大语言模型(LLM)服务已成为关键的云上工作负载,真实的负载轨迹对于推动和基准测试服务系统至关重要。然而,现有的LLM服务工作负载研究在规模和范围上仍然有限:它们通常只观察较短的时间段,对用户在生产环境中如何与模型交互提供的可见性有限。因此,它们无法完整刻画LLM服务工作负载如何随时间演化,以及用户与模型的交互如何塑造生产流量。在这项工作中,我们通过对Chutes一年生产轨迹的全局刻画与纵向研究,进一步加深对真实LLM服务工作负载的理解。与以往研究不同,我们的轨迹捕捉了跨多个模型与用户的完整生产行为,既包括热门模型也包括长尾模型。我们从聚合、时间、模型和用户四个层面分析该负载,揭示了通常隐藏在聚合视图背后的负载演化与用户-模型结构。为支持后续研究,我们计划随论文发布完整的一年轨迹,使下游研究无需依赖采样或合成生成的负载。

LLM服务的一年纵览:负载演化、缓存与负载均衡:论文配图
(a) 每日请求速率 (b) 每日 token 速率 (c) 每日活跃模型 (d) 每日 API 调用 (e) 请求热力图 图1. 每日请求量、token 量、活跃模型和 API 构成在一年中的演变各不相同,表明生产负载是非平稳的,无法仅用请求数量来概括。