论文

PARE:修剪和自适应路由以实现高效视频生成

PARE: Pruning and Adaptive Routing for Efficient Video Generation

模型优化模型压缩

摘要

视频扩散 Transformer (DiT) 生成高质量视频,但由于宽块、深层架构和迭代采样,需要大量计算。最近的方法通过压缩宽度、深度或采样步骤来降低成本,但通常采用无法适应单独输入或降噪阶段的固定架构。我们提出了 PARE(用于高效视频生成的修剪和自适应路由),它通过结构感知修剪和输入自适应路由联合压缩宽度和深度。对于宽度,我们观察到注意力头专注于空间和时间角色,并设计重要性评分来解释这种区别,以防止运动关键的时间头被过早修剪。对于深度,我们训练一个以去噪时间步长和视觉内容为条件的轻量级路由器,以动态选择在每个步骤执行哪些块,从而实现每个输入的计算适应而不是静态块删除。渐进式管道首先通过 蒸馏 恢复宽度修剪质量,然后联合优化学生和路由器以解耦两个学习目标。在 Wan2.1-14B 上进行的图像到视频和文本到视频生成的实验表明,PARE 大大减少了每步计算量,同时在 VBench 维度上保持质​​量,并与步骤 蒸馏 组合以进一步加速。