论文
FreqFormer:具有自适应谱路由的分层频域注意力,用于长序列视频扩散 Transformer
FreqFormer: Hierarchical Frequency-Domain Attention with Adaptive Spectral Routing for Long-Sequence Video Diffusion Transformers
摘要
长序列视频扩散 Transformer 达到了二次自注意力成本,该成本在很长的词元序列中主导运行时间和内存。最有效的注意力方法在任何地方都使用一种近似,但视频特征是频谱结构的:低频带有全局布局和粗略运动;高频带有纹理和精细的细节。我们提出 FreqFormer,一种频率感知的异构注意力框架。词元特征被分成具有不同运算符的频带:压缩低频内容的密集全局注意力,中频的结构化块稀疏注意力,以及高频的滑动窗口局部注意力。轻量级频谱路由网络使用层统计数据和扩散时间步长跨频带分配头,在去噪和细节处理的早期将计算转向全局结构。跨频带摘要词元以较低成本交换残差信息。 FreqFormer 与融合的 GPU 执行计划配对,共同调度密集、稀疏和本地分支,以减少内核启动和内存流量。我们给出了一致的复杂性模型、近似的正交分解视图以及基于模拟的系统数字(吞吐量、算术强度、内存流量、持续时间缩放)。在从 64K 到 1M 词元的模拟中,与密集注意力相比,FreqFormer 大大减少了估计注意力 FLOP 和 KV 相关的内存流量,同时保持硬件友好的模式,支持谱结构异构注意力作为长视频扩散的实用方向 Transformer。