论文
并非所有词元都需要 40 个步骤:扩散 Transformer 中的异构步骤分配以实现高效视频生成
Not All Tokens Need 40 Steps: Heterogeneous Step Allocation in Diffusion Transformers for Efficient Video Generation
摘要
Diffusion Transformer (DiTs) 已经实现了最先进的视频生成质量,但它们会产生巨大的计算成本,因为标准推理对序列中的每个标记统一应用相同数量的去噪步骤。众所周知,人类视觉会忽略大量冗余运动。那么,为什么我们最密集的模型要同等优先级对待每个时空标记呢?在本文中,我们介绍了异构步骤分配(HSA),这是一种 无需训练 推理算法,该算法根据不同的时空词元的速度动态将不同的步骤预算分配给不同的时空词元。为了在不牺牲全局上下文的情况下解决由此产生的序列长度不匹配问题,HSA 引入了 KV 缓存同步机制,允许活动词元参与完整序列,同时完全绕过非活动词元。此外,我们导出了一个缓存的欧拉更新,该更新可以在单个操作中推进跳过标记的潜在状态,而无需额外的模型评估。我们在 Wan-2 和 LTX-2 模型上评估 HSA 的文本到视频 (T2V) 和图像到视频 (I2V) 生成。我们的结果表明,HSA 的性能显着优于以前最先进的缓存方法和普通流匹配基线,特别是在激进的加速方案(例如 50% 和 25% 运行时)下。至关重要的是,HSA 无需昂贵的离线分析即可实现卓越的质量运行时帕累托前沿,即使在计算预算紧张的情况下也能稳健地保持结构完整性和生成质量。项目页面:https://ernestchu.github.io/hsa