论文
表征 LLM 服务的高带宽闪存
Characterizing High Bandwidth Flash for LLM Serving
摘要
大语言模型 (LLM) 服务需要大量内存来存储模型权重和 KV 缓存。随着模型变得越来越大,上下文变得越来越长,内存容量和带宽越来越成为服务性能的瓶颈。 Agentic 工作负载通过不断增长的上下文中的重复交互加剧了这种压力,使得保留 KV 状态以供重用变得越来越重要。高带宽闪存 (HBF) 提供了一种扩展大语言模型 (LLM) 服务的加速器内存容量的方法,但其访问成本和有限的写入耐久性使其使用变得复杂。我们评估 HBF 的高吞吐量 Agentic 跨系统设计和调度选择的服务,以了解额外的容量何时可以提高服务性能和能源效率。我们引入了 HBM-HBF-主机分层存储系统和缓冲缓存感知调度,并使用跟踪驱动的模拟来分析它们对性能、能耗和 HBF 写入寿命的影响。在评估的工作负载中,相对于仅使用 HBM 的系统,最快的 HBF 增强系统将完成时间缩短了 36.1-87.0%。尽管 HBF 增加了某些轻量工作负载的能耗,但建模的节能效果达到 55.8%。在评估的配置中,缓冲缓存感知调度将估计的 HBF 写入寿命从 4.77 年延长至 14.82 年。这些结果证明了协调数据放置和调度对于提高服务效率同时维持实际 HBF 写入寿命的重要性。