论文

潜在帧间修剪:一种连接传统视频压缩和现代扩散的 无需训练 方法 Transformer 以实现高效生成

Latent Inter-Frame Pruning: A Training-Free Method Bridging Traditional Video Compression and Modern Diffusion Transformers for Efficient Generation

模型推理推理加速

摘要

视频生成虽然能够生成逼真的视频,但计算成本高且速度慢,阻碍了实时应用。在本文中,我们观察到在潜在扩散模型(LDM)框架下通过自动编码器编码的视频潜在信息包含沿时间轴的冗余。与传统视频压缩算法如何避免传输冗余帧数据类似,我们提出了潜在帧间修剪框架来修剪(跳过重新计算)重复的潜在补丁,从而减少计算负担并提高吞吐量。然而,由于全序列训练和修剪推理之间的差异,直接修剪会导致视觉伪影。为了解决这些问题,我们提出了一种注意力恢复机制来弥补训练与推理之间的差距。通过我们提出的方法,我们将视频编辑吞吐量提高了 1.44$\times$,在 NVIDIA RTX 6000 上实现了 12.44 FPS,同时保持了视频质量。我们希望我们的工作能够激发进一步的研究,将传统视频压缩方法与现代视频生成管道相集成。这项工作是 无需训练 Latent Inter-Frame Pruning with Attention Recovery 的初步工作。