论文
SPADE:用于快速视频扩散模型推理的输入自适应稀疏注意力引擎
SPADE: An Input-Adaptive Sparse Attention Engine for Fast Video Diffusion Models Inference
摘要
视频扩散 Transformer (vDiTs) 产生高质量,但付出二次自注意力成本,使得在视频词元规模上的推理令人望而却步。挑战在于输入自适应稀疏性:选择开销可忽略不计的关键 Q/K/V 词元并执行它们以获得端到端增益。我们提出了 SPADE,一个由三部分组成的 无需训练 稀疏注意力引擎:(i) vDiT-SSR,一个定义 3D 阻塞候选者并通过 Summarizer/Estimator 表达式形式化动态掩码的规范; (ii) 使用 SICS 和 head-wise 策略生成运行时方案; (iii) 具有低开销索引搜索、闪存块稀疏注意力和内核分组的执行器。在用于文本到视频和图像到视频生成的混源视频和 Wan 2.1/2.2 中,SPADE 在保持质量的同时提高了稀疏性和速度,将注意力加速了 2.26x-3.40 倍,将端到端推理加速了 1.49x-1.80 倍。我们的代码在 https://github.com/6somehow/DAC-SPADE 上开源。