论文
理解和利用自回归图像生成中的对角注意力稀疏性
Understanding and Exploiting Diagonal Attention Sparsity in Autoregressive Image Generation
摘要
由于自回归图像生成与基于Transformer的 LLM 服务基础设施的兼容性,它已成为多模式人工智能系统的范例。然而,每个请求生成数千个视觉标记使得解码在注意力计算期间越来越受到 KV 缓存访问的瓶颈。稀疏注意力对于这种工作负载特别有吸引力,因为许多视觉生成应用程序可以容忍适度的质量下降,以换取性能和效率的提高。虽然稀疏注意力已经在基于文本的 LLM 推理中得到了广泛的探索,但仍不清楚其稀疏性假设是否可以有效地推广到自回归图像生成。我们首次系统地描述了跨不同工作负载和代表性开源模型的自回归图像生成中的注意力稀疏性。我们的分析揭示了几个显着的特性,包括明显的预填充解码不对称性、对提示和局部标记的强烈注意力集中,以及由视觉标记的空间局部性产生的独特的对角注意力稀疏模式。受这些观察的启发,我们提出了一种对角线感知的稀疏注意力机制,该机制可以在最近的窗口内沿着对角线注意力方向选择性地跳过 KV 条目。我们的方法是在使用 FlexGen、FlashAttention-2 和自定义内核的基于 GPU 的服务系统之上实现的,与密集推理相比,吞吐量提高了 3.1 倍,延迟提高了 1.19 倍,质量下降不到 2%。