论文
VecAttention:用于加速长上下文推理的向量稀疏注意力
VecAttention: Vector-wise Sparse Attention for Accelerating Long Context Inference
摘要
由于自注意力的二次复杂度,长上下文视频理解和生成对基于 Transformer 的视频模型提出了重大的计算挑战。虽然现有的稀疏注意力方法采用粗粒度模式来提高效率,但它们通常会导致冗余计算和次优性能。为了解决这个问题,在本文中,我们提出了 \textbf{VecAttention},这是一种向量稀疏注意力的新颖框架,可以为视频模型实现卓越的准确性-效率权衡。我们观察到视频注意力图表现出强大的垂直向量稀疏模式,并进一步证明与现有的粗粒度稀疏模式相比,这种垂直向量模式始终提供更好的准确性-稀疏性权衡。基于这一观察,VecAttention 通过最小化内存访问开销的轻量级重要向量选择和向量稀疏注意力的优化内核,仅动态选择和处理信息丰富的垂直向量。对视频理解(VideoMME、LongVideoBench 和 VCRBench)和生成(VBench)任务的综合评估表明,VecAttention 比完全注意力方法提速 2.65$\times$,比最先进的稀疏注意力方法提速 1.83$\times$,且准确度与完全注意力相当。我们的代码可在 https://github.com/anminliu/VecAttention 获取。