论文

FVAttn:具有运行时负载平衡的自适应稀疏注意力,用于视频生成

FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation

模型推理批处理与并行

摘要

Video Diffusion Transformer 处理长时空序列,使自注意力成为高分辨率视频生成的主要瓶颈。 无需训练 稀疏注意力降低了这种成本,但自适应 Top-$p$ 路由在多 GPU 序列并行性下会产生不均匀的每头工作负载。由此产生的工作负载异质性将稀疏的注意力变成了排名级别的掉队问题。我们提出了 \method{},一个 无需训练 稀疏注意力系统,它提高了多 GPU 序列并行下自适应稀疏注意力的分布式执行效率。 \method{} 使用 Top-$p$ 路由、Top-$k$ 安全层和视频感知块组织作为稀疏路由前端,然后在运行时修复物化掩码。运行时负载均衡通过P2P通信迁移少量重头,以缩短当前的关键路径。松弛感知稀疏增强用额外的高价值块填充剩余的非关键等级松弛,而重叠隐藏了现有计算背后的调度和迁移开销。在逐步蒸馏的 Wan2.2 I2V 上,\method{} 将平均负载不平衡从 1.34 降低到 1.08,并提供比 FlashAttention $4.41\times$ 的注意力加速,同时在具有竞争力的视频质量下实现 $2.02$--$2.11\times$ DiT 推理加速。