论文
稀疏强迫:用于实时自回归扩散视频生成的本机可训练稀疏注意力
Sparse Forcing: Native Trainable Sparse Attention for Real-time Autoregressive Diffusion Video Generation
摘要
我们引入了稀疏强制,这是一种用于自回归视频扩散模型的训练和推理范例,可提高长视域生成质量,同时减少解码延迟。稀疏强迫的动机是自回归扩散生成轨迹中的经验观察:注意力集中在显着视觉块的持久子集上,在 KV 缓存中形成隐式时空记忆,并在滑动窗口内呈现局部结构化的块稀疏模式。基于这一观察,我们提出了一种可训练的本机稀疏机制,该机制学习压缩、保留和更新这些持久块,同时将每个局部窗口内的计算限制为动态选择的局部邻域。为了使该方法在训练和推理中大规模实用,我们进一步提出了持久块稀疏注意力(PBSA),这是一种高效的 GPU 内核,可以加速稀疏注意力和内存更新,以实现低延迟、内存高效的解码。实验表明,在 5 秒文本到视频生成过程中,Sparse Forcing 的 VBench 分数比 Self-Forcing 提高了 +0.26,同时解码速度提高了 1.11-1.17 倍,峰值 KV 缓存占用空间降低了 42%。在更长的生成轨迹中,收益更加明显,通过 +0.68 和 +2.74 VBench 改进提供了更高的视觉质量,并且在 20 秒和 1分钟生成上分别实现了 1.22 倍和 1.27 倍的加速。