论文
FlashPrefill V2:用于长上下文 LLM 服务的块稀疏预填充注意力
FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving
摘要
长上下文建模是 大语言模型 的关键功能,但注意力的二次复杂性仍然是一个关键瓶颈,特别是在计算密集型预填充阶段。我们之前的工作 FlashPrefill 通过即时模式发现和基于最大值的动态阈值来降低这种成本;然而,它仍然是一个算法原型,距离生产部署还很遥远。在本文中,我们提出了 FlashPrefill V2,它将 FlashPrefill 从原型发展为沿三个维度的实用长上下文服务。首先,我们引入了一个均值校正项,它可以有效地抑制近似误差,即使在极端稀疏的情况下也能保持性能下降的可控性。其次,我们通过 PackGQA 内存访问、warp 专门化和乒乓流水线重新设计了稀疏注意力算子,与最新的 FlashAttention-3/4 实现完全一致,并支持 FP8 推理以满足实际的量化要求。第三,FlashPrefill V2 本身支持分页 KV 缓存和连续批处理,允许作为注意力后端集成到 SGLang 等现代推理框架中。对 NVIDIA H20 GPU(部署最广泛的推理加速器之一)的广泛评估表明,在 FP8 和 BF16 精度下,FlashPrefill V2 在 128K 上下文长度下分别比 FlashAttention-2 实现了 47.26 倍和 27.19 倍的加速,并且在 FP8 中,相对于 FA3/4 对齐的密集基线,仍然实现了 30.49 倍的加速。