论文

LLM 推理瞬间完成!

LLM Inference in a Flash!

AI 基础设施模型部署

摘要

大型语言模型 (LLM) 在一系列自然语言处理任务中表现出了令人印象深刻的能力,LLM 推理已成为支持下游应用程序的关键工作负载。在检索增强生成、推理时间计算扩展和长上下文应用程序的推动下,随着请求转向更长的序列和更重的推理,服务 LLM 推理的需求变得越来越具有挑战性。此外,硬件趋势加剧了这些挑战,因为内存容量和通信带宽的扩展速度赶不上工作负载复杂性的增加。闪存计算是一种很有前景的解决方案,可通过将计算移至内存附近并利用 SSD 技术的大容量来解决内存带宽限制。然而,在这些系统上部署 LLM 具有挑战性,因为它们缺乏对高精度浮点运算的支持并且写入耐久性有限。在我们的工作中,我们的目标是通过设计推理算法以在闪存计算内存设备上实现 LLM 推理来应对这些挑战。我们提出了一种端到端的纯整数量化方法来消除昂贵的浮点计算。为了解决有限的写入耐久性,我们设计了一种基于稀疏字典编码的基于字典的 KV 缓存压缩策略,该策略将每个 KV 向量表示为静态字典向量的线性组合。这些算法改进使我们能够利用闪存计算的模型权重和 KV 缓存的优势,并最大限度地减少昂贵的数据传输操作。在 Llama-3.1-8B 和 Qwen-2.5-7B 中,我们的组合方法表现出有限的精度下降,同时将动态 KV 缓存流量减少了 15$\times$。