论文

ScalingAttention:发现视频扩散的内在稀疏注意力拓扑 Transformer

ScalingAttention: Discovering Intrinsic Sparse Attention Topology for Video Diffusion Transformers

模型推理推理加速

摘要

虽然 Diffusion Transformer (DiTs) 彻底改变了高保真视频生成,但它们对 3D 完全注意力的依赖造成了二次计算瓶颈。现有的稀疏方法面临着一个困境:动态修剪面临着令人望而却步的运行时开销和内存碎片,而静态启发式方法无法捕获细粒度的依赖关系。在这项工作中,我们提出了 ScalingAttention,一个基于关键归纳偏差的 无需训练 框架:虽然个体激活是依赖于输入的,但每个头的高质量注意力区域迅速收敛到一个稳定的、与提示无关的内在稀疏拓扑。该拓扑是权重编码的、尺度不变的并且提取效率高。 ScalingAttention 通过以下方式将拓扑发现与稀疏性控制解耦:(1)WEST(权重编码稀疏拓扑),离线提取鲁棒的块稀疏先验掩码以消除运行时搜索; (2)FAST(Fidelity-Aware Sensitivity Tuning),它根据扩散保真度要求自适应地调整头部稀疏性。为了确保实际加速,我们共同设计了一个硬件对齐的按位块稀疏内核。 Wan2.1 上的实验显示,端到端加速高达 1.90 倍,保真度极高,在最先进的基线上建立了新的帕累托前沿。