论文
ScoutAttention:通过用于 LLM 推理的 Layer-Ahead CPU 预计算实现高效的 KV 缓存卸载
ScoutAttention: Efficient KV Cache Offloading via Layer-Ahead CPU Pre-computation for LLM Inference
摘要
大语言模型 在长上下文推理期间遇到关键的 GPU 内存容量限制,其中 KV 缓存内存消耗严重限制了解码批量大小。虽然现有研究已经探索将 KV 缓存卸载到 DRAM,但这些方法要么需要频繁的 GPU-CPU 数据传输,要么强加大量的 CPU 计算要求,导致系统等待 I/O 操作或 CPU 处理完成时 GPU 利用率较低。我们提出了 ScoutAttention,这是一种新颖的 KV 缓存卸载框架,可通过 GPU-CPU 协作注意力计算来加速 LLM 推理。为了防止 CPU 计算成为系统瓶颈,ScoutAttention 引入了 GPU-CPU 协作的块级稀疏注意力,可显着降低 CPU 负载。与传统的并行计算方法不同,我们的框架采用了一种新颖的提前层 CPU 预计算算法,使 CPU 能够提前一层启动注意力计算,并辅之以异步定期召回机制,以保持最小的 CPU 计算负载。实验结果表明,与现有卸载方法相比,ScoutAttention 的准确度保持在基线的 2.4% 以内,同时实现了 2.1 倍的加速。