论文

CSAttention:用于加速 LLM 推理的质心评分注意力

CSAttention: Centroid-Scoring Attention for Accelerating LLM Inference

模型推理推理加速

摘要

长上下文 LLM 越来越依赖于代理和域问答的扩展、可重用预填充提示,促使注意力和 KV 缓存成为主要的解码时间瓶颈。虽然稀疏注意力降低了计算和传输成本,但由于查询和键之间固有的分布变化,它通常很难在高稀疏性水平上保持准确性。我们提出了质心评分注意力(CSAttention),这是一种针对可重用上下文的高吞吐量服务而优化的 无需训练 稀疏注意力方法。 CSAttention 采用一种针对离线预填充/在线解码设置量身定制的存储计算策略:它将计算预先加载到一次性离线预填充阶段,该阶段可以在多个查询之间分摊,同时积极优化每步解码延迟。具体来说,CSAttention 在离线预填充期间构建以查询为中心的查找表,其大小在解码期间保持固定,并支持在线解码以高效的表查找和 GPU 友好的分数累积来取代全上下文扫描。大量实验表明,CSAttention 实现了与完全注意力几乎相同的准确度。在高稀疏度 (95%) 和长上下文设置 (32K-128K) 下,CSAttention 在模型精度和推理速度方面始终优于最先进的稀疏注意力方法,在 128K 上下文长度下比最准确的基线实现高达 4.6 倍的推理加速。