论文
用于高效基于扩散的视频生成的时间感知修剪
Temporal Aware Pruning for Efficient Diffusion-based Video Generation
摘要
视频扩散模型最近通过基于 ViT 的架构实现了高质量视频生成,但仍然需要大量计算,因为生成需要对长时空序列进行注意力计算。事实证明,词元修剪对于 ViT 和 VLM 是有效的。然而,大多数现有的剪枝方法都是基于注意力的,并且按帧进行操作,无法确保视频生成任务中帧间重要的时间连贯性。在实践中,天真地采用仅注意修剪会由于背景一致性恶化、闪烁和图像质量下降而导致明显的退化。为了解决这个问题,我们提出了 TAPE,一种用于高效基于扩散的视频生成的 无需训练 时间感知修剪。 TAPE (i) 应用时间平滑来对齐相邻帧之间的标记重要性并抑制选择抖动; (ii) 在选定的层中执行标记重新选择,以使标记修剪与层的不同语义焦点保持一致,并避免特定区域中的错误累积;它还(iii)采用时间步级预算调度,在早期的噪声步骤中进行积极的修剪,并在保真度关键的细化过程中放松修剪。实验结果表明,TAPE 在保持高视觉保真度的同时提供了显着的加速,优于之前的词元缩减方法。