论文

iCATS:通过交互感知稀疏注意力和时间步自适应稀疏性快速生成视频

iCATS: Fast Video Generation via Interaction-Aware Sparse Attention and Timestep-Adaptive Sparsity

模型推理模型优化推理加速稀疏化

摘要

免训练稀疏注意力通过减少计算而无需微调,为扩散Transformer(DiT)提供了实用的加速解决方案。它通常涉及估计查询关键区域的重要性并导出稀疏掩码以仅计算重要的候选区域,这不可避免地会引入可能降低生成质量的近似误差。为了更好地平衡效率与质量的权衡,我们提出了 iCATS,将改进的重要性估计和稀疏掩模构造与高效的硬件执行策略相结合。具体来说,对于重要性估计,与之前基于特征相似性对查询和关键标记执行独立聚类来估计注意力分数的工作不同,iCATS 证明基于查询-关键点-积交互的聚类更加准确,并进一步将此目标重新表述为简单的二次形式以实现低成本计算。对于稀疏掩模构造,我们没有使用固定的 top-p 规则,而是观察到对稀疏近似误差的容忍度随着去噪时间步长的不同而变化,并且 因此,引入 SNR 引导的稀疏度计划来动态调整稀疏度,从而获得更高的精度。最后,对于硬件执行,我们设计了尾部合并策略来减少由不规则簇大小引起的填充开销,从而提高 GPU 内核利用率。大量实验表明,iCATS 在 HunyuanVideo-T2V-13B 上实现了 2.03 美元的加速,PSNR 为 31.017 dB,在 Wan2.1-T2V-14B 上实现了 1.55 倍的加速,PSNR 为 29.301 dB,实现了最先进的效率与质量权衡。