论文

HyperVAttention:用于视频扩散的时空聚类的高效稀疏注意力

HyperVAttention: Efficient Sparse Attention with Spatio-Temporal Clustering for Video Diffusion

模型推理推理加速

摘要

Video Diffusion Transformer (VDiTs) 在高保真视频生成方面展示了显着的功能。然而,它们制作长时间视频的能力从根本上受到自注意力机制的二次复杂度的限制。最近基于聚类的稀疏注意力方法通过对语义相似的标记进行分组来改善质量与速度的权衡,但其实际效率仍然受到两个瓶颈的限制:大量的聚类开销和由不规则聚类引起的块导致的低 CTA 利用率。我们提出了 HyperVAttention (HVA),这是一种 无需训练 稀疏注意力框架,可以共同解决这两个瓶颈。为了减少聚类开销,我们引入了 3D 本地窗口聚类,它利用视频标记的时空局部性将质心搜索限制在固定的局部邻域,并使用自定义的 Triton 内核来实现它以实现高效执行。我们进一步提出了一种混合聚类策略,仅在锚定步骤执行完整聚类,并在中间步骤仅更新子集标记,利用去噪步骤之间聚类分配的时间稳定性。为了提高 CTA 利用率,我们提出了硬件感知集群合并,通过并行聚合合并最大限度地减少 CTA 对齐的执行成本,并通过利用空闲切片容量来提高块密度和近似保真度。这些组件共同减少了集群开销,避免了冗余更新,并更好地将稀疏注意力与现代 GPU 内核的固定图块结构保持一致。文本到视频生成的实验表明,HVA 为视频扩散中的 无需训练 稀疏注意力建立了新的帕累托前沿,将端到端延迟减少了高达 $2.13\times$,同时提高了现有 无需训练 稀疏注意力基线的保真度。