论文
将稀疏注意力与分层内存相结合,实现可扩展的长上下文 LLM 服务
Unifying Sparse Attention with Hierarchical Memory for Scalable Long-Context LLM Serving
摘要
长上下文 LLM 服务因参与不断增长的 KV 缓存的成本而成为瓶颈。动态稀疏注意力通过在每个解码步骤仅访问 KV 状态的一个小的、依赖于查询的子集并将 KV 存储扩展到 CPU 内存来缓解压力。然而,在实践中,这些算法节省很少转化为端到端系统级收益,因为稀疏方法通常在不同的粒度上运行,因此依赖于特定的、按算法的实现。同时,分层 KV 存储引入了新的系统瓶颈:跨 GPU-CPU 边界检索细粒度、不规则的 KV 子集很容易消除稀疏性的好处。我们提出了 SPIN,一个稀疏注意力感知推理框架,它通过三种技术共同设计执行管道和分层 KV 存储:(1)统一分区抽象,将不同的稀疏粒度映射到基于共享页面的 KV 底层; (2) 局部感知 KV 缓存管理器,动态调整每个请求的 HBM 预算,并使用 GPU 友好的分桶 LRU 策略来减少 PCIe 往返; (3) 两级分层元数据布局,其大小适合活动工作集而不是最坏情况的地址空间。 SPIN 基于 vLLM 构建,采用三种代表性的稀疏注意力算法,与 vLLM 相比,端到端吞吐量提高了 1.66-5.66 倍,TTFT 降低了 7-9 倍,并且与原始稀疏注意力实现相比,TPOT 减少了高达 58%。