论文

BASA:复用现有后端的高分辨率稀疏注意力

Backend-Agnostic Sparse Attention for Fast High-Resolution Visual Generation

模型优化稀疏化

摘要

扩散Transformer(DiT)在图像与视频生成表现强,但全注意力二次复杂度使高分辨率昂贵。分区窗口效率接近理论,却阻断跨窗交流并造成网格伪影;细粒滑窗恢复交流,但不规则计算使理论与实际加速差距大,且需后端专用内核。BASA以结构化移位局部窗口代替视觉自注意力,在不同DiT块移动窗口,使某层被边界分开的词元可在后续层交流,实现全局信息交换并消除窗口伪影。不增加不规则算子或定制内核,可直接部署现有注意力后端。FLUX的实测加速超过理论估计的90%,Wan注意力加速4.52倍,并保持有竞争力的生成质量。

BASA:复用现有后端的高分辨率稀疏注意力:论文原图
图 3:BASA 概述。 (a)提出的稀疏注意力框架集成了多个组件,以在降低注意力成本的情况下恢复局部和全局视觉交互。 (b) BASA 用作 DiT 块中视觉自注意力模块的直接替代品,而其余生成管道保持不变。