论文

Veda:通过蒸馏稀疏注意力进行可扩展的视频扩散

Veda: Scalable Video Diffusion via Distilled Sparse Attention

模型推理推理加速

摘要

缩放 Diffusion Transformer 来生成高分辨率、长视频受到自注意力二次成本的限制,并且现有的稀疏注意力方法在高稀疏性下会退化。我们凭经验证明,生成质量不是由稀疏率本身决定的,而是由稀疏掩模与充分关注的分块几何结构的对齐程度决定的。基于这一见解,我们提出了 Veda,一种精炼的稀疏注意力框架,它将图块选择制定为完全注意力的显式重建问题。 Veda 将统计感知切片评分与头部感知切片集成在一起,以减少估计误差和结构不匹配,从而实现积极的稀疏性。硬件高效的瓦片跳跃内核将理论稀疏性转化为实际的挂钟加速。对大型视频扩散模型(包括 Waver 和 Wan2.1)的实验表明,在生成质量没有明显下降的情况下,速度显着加快。为了在 Waver-T2V-12B 上生成 720P 10 秒视频,Veda 实现了 5.1$\times$ 端到端加速和 10.5$\times$ 自注意力加速,将注意力开销从 92% 降低到 50%。值得注意的是,增益随着序列长度的增加而增加,这表明 Veda 可以随着模型的时空分辨率而有利地扩展。