论文

SparkDiffusion:缓解高稀疏性陷阱 --- 视觉生成单 GPU 加速高达 265 美元\次的统一框架

SparkDiffusion: Mitigating the High-Sparsity Trap --- A Unified Framework for up to $265\times$ Single-GPU Acceleration of Visual Generation

模型优化模型压缩

摘要

视频扩散Transformer很昂贵,因为注意力主导着长时空标记序列。我们发现了\emph{高稀疏性陷阱}:在注意力极度稀疏的情况下,步局部训练损失不断减少,而终端生成质量停滞或下降。陷阱之一是监督:主要的终端错误起源于高噪声结构生成阶段,终端对齐训练可以纠正实质上扩展的步局部训练无法纠正的终端错误。这产生了一个简单的分级原则:\emph{首先将稀疏架构调整为粗略先验,然后纠正终端分布}。我们将该原理实例化为 \method,这是一个用于视觉生成的统一加速框架,结合了短稀疏预热、少步轨迹混合蒸馏以及带有融合内核的 FP8 量化。该方法在跨 Wan2.1/Wan2.2 主干和 T2V/I2V 任务的长序列 720P 生成上维持了 97\%$ 的注意力稀疏性和强大的视觉质量,在 Wan2.1-T2V-1.3B-480P 上维持了 90\%$ 的稀疏性。通过 3 步无 CFG 推理,该方法在单个 RTX~5090 上的 Wan2.1-T2V-14B-720P 的 50 步 CFG 密集基线上实现了 265 美元的端到端加速(在 H100 上为 220 美元),并对 Wan2.1-T2V-1.3B-480P 视频进行降噪$1.3$s。