论文
BASA:复用现有后端的高分辨率稀疏注意力
Backend-Agnostic Sparse Attention for Fast High-Resolution Visual Generation
摘要
扩散Transformer(DiT)在图像与视频生成表现强,但全注意力二次复杂度使高分辨率昂贵。分区窗口效率接近理论,却阻断跨窗交流并造成网格伪影;细粒滑窗恢复交流,但不规则计算使理论与实际加速差距大,且需后端专用内核。BASA以结构化移位局部窗口代替视觉自注意力,在不同DiT块移动窗口,使某层被边界分开的词元可在后续层交流,实现全局信息交换并消除窗口伪影。不增加不规则算子或定制内核,可直接部署现有注意力后端。FLUX的实测加速超过理论估计的90%,Wan注意力加速4.52倍,并保持有竞争力的生成质量。
