论文
RhymeFlow:通过异步去噪流调度实现视频生成的 无需训练 加速
RhymeFlow: Training-Free Acceleration for Video Generation with Asynchronous Denoising Flow Scheduling
摘要
基于 Diffusion Transformer (DiTs) 的视频生成模型在视频合成方面取得了显着的性能,但由于 3D 注意力的二次复杂度,它们存在较高的推理延迟和计算成本。现有的加速方法主要通过稀疏注意力和 KV 缓存等技术来降低每个单独去噪步骤中的计算复杂性。然而,它们严格遵守标准扩散管道的固有约束:目标视频序列中的每一帧都必须在所有扩散时间步上经过完整、密集的去噪过程。我们观察到,由于相邻帧之间相应的内容和运动,当锚定具有关键语义转换的关键帧时,其他帧的中间状态通常遵循更可预测的轨迹,这表明这种均匀、密集的去噪过程对于自然视频数据来说本质上是冗余的。为此,我们引入了 \textbf{RhymeFlow},一个 无需训练 框架,可以解耦不同帧的去噪轨迹。具体来说,我们首先确定一组稀疏的关键关键帧,它们主导潜在的语义演化。然后,只有这些关键帧经过密集的、逐步的去噪以确保结构完整性,而非关键帧则逐步跳过去噪步骤以最小化计算成本。由于跳过的非关键帧的中间状态破坏了关键帧去噪步骤中的时间连贯性,导致视觉退化,因此我们进一步引入了潜在轨迹投影模块,该模块使关键帧能够与完整且时间一致的序列表示进行交互。对当前基于 DiT 的视频生成模型的大量实验表明,我们的方法优于现有基线,具有更高的推理速度和更好的视觉质量。