论文

通过异构缓存加速基于扩散的视频编辑:超越采样去噪时间步长的完整计算

Accelerating Diffusion-based Video Editing via Heterogeneous Caching: Beyond Full Computing at Sampled Denoising Timestep

模型推理推理加速

摘要

基于扩散的视频编辑已成为高质量和灵活内容生成的重要范例。然而,尽管 Diffusion Transformer (DiT) 具有通用性和强大的建模能力,但由于迭代去噪过程,计算成本仍然很高,这给实际部署带来了挑战。现有的视频扩散加速方法主要利用去噪时间步级特征重用,这减轻了去噪过程​​中的冗余,但忽略了 DiT 中的架构冗余,即许多时空标记上的注意力操作都是冗余执行的,对模型输出几乎没有增量贡献。这项工作引入了 HetCache,这是一种 无需训练 扩散加速框架,旨在利用基于扩散的蒙版视频到视频 (MV2V) 生成和编辑中固有的异构性。 HetCache不是统一重用或随机采样词元,而是在指定的计算步骤中评估各种类型词元之间的上下文相关性和交互强度。在空间先验的指导下,它将DiT模型中的时空标记分为上下文标记和生成标记,并选择性地缓存与生成标记表现出最强相关性和最具代表性语义的上下文标记。该策略减少了冗余的注意力操作,同时保持了编辑的一致性和保真度。实验表明,与常用的基础模型相比,HetCache 实现了显着的加速,包括 2.67$\times$ 的延迟加速和 FLOP 减少,而编辑质量的下降可以忽略不计。