论文
重新思考流视频传播模型:上下文、执行和训练
Rethinking Streaming Video Diffusion Model: Context, Execution, and Training
摘要
了解流视频扩散的设计空间对于探索其生成质量和计算效率的潜力至关重要。我们开发了一个统一的分析框架,将模型和采样器选择、历史条件、执行调度和训练策略联系起来。该框架容纳了广泛的因果上下文选择策略,并使它们的计算依赖性和训练推理对齐变得明确。在这个设计空间中,我们研究了三种代表性政策:清洁、同级和进步历史。在完整的 VBench 提示集上,同级历史记录和渐进历史记录的总分分别为 85.24 和 85.60,而干净历史参考的总分为 84.45。长视频比较进一步显示了主题一致性的提高以及随着历史的进步而更加连贯的运动。通过允许多个去噪节点一起处理,渐进式历史流水线在我们评估的条件下实现了 $1.57$-$2.83\times$ 稳态 DiT 加速。我们还发现,DMD 假分数网络的 LoRA 适应仅使用全参数适应的 2.15% 的可训练假分数参数来提高生成质量。总之,这些发现表明,完全去噪的历史并不是高质量流生成的先决条件,并激发了历史调节、执行和训练的联合设计。