论文
FIS-DiT:通过 无需训练 帧交错稀疏性打破少步视频推理障碍
FIS-DiT: Breaking the Few-Step Video Inference Barrier via Training-Free Frame Interleaved Sparsity
摘要
虽然视频扩散 Transformer (DiTs) 的整体推理延迟可以通过模型 蒸馏 大幅减少,但每步推理延迟仍然是一个关键瓶颈。现有的加速范例主要利用去噪轨迹上的冗余;然而,我们发现了一个局限性,即这些逐步策略在几步制度中会遇到收益递减的情况。在这种情况下,较少的中间状态可能会限制特征重用或预测建模的机会,从而激发互补形式的加速。为了克服这个问题,我们提出了帧交错稀疏 DiT (FIS-DiT),这是一个 无需训练 和操作员无关的框架,它将优化焦点从时间轨迹转移到潜在帧维度。我们的方法是受到这个维度内内在二元性的启发:帧稀疏性的存在允许减少计算,再加上结构一致性,要求在全局时空上下文中保持帧位置的覆盖。利用这种洞察力,我们将帧交错稀疏性 (FIS) 实现为一种执行策略,可以跨模型层次结构操纵帧子集,刷新所有潜在位置,而无需进行全面的块计算。对 Wan 2.2 和 HunyuanVideo 1.5 的实证评估表明,FIS-DiT 实现了 2.4$\times$ 加速,同时在 VBench 上保持相当的性能,为实时高清视频生成提供了可扩展且强大的途径。