论文

TunerDiT:用于多事件视频生成的 无需训练 扩散 Transformer 的渐进式转向

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation

模型推理解码与生成控制

摘要

在生成包含多个事件的长视野视频时,文本到视频 (T2V) 生成面临着具有挑战性的问题。受扩散过程内在本质的启发,我们探索了视频扩散 Transformer (DiTs),并揭示了 DiT 去噪轨迹中的内在转折点,其中条件文本影响从全局布局到细粒度细节的生成。基于这一发现,我们提出了 TunerDiT,这是一种简单而有效的渐进式转向方法,不需要额外的多事件生成训练。 TunerDiT 包括两个控制手柄:(1) 事件分区屏蔽,强制事件边界,同时允许跨事件过渡带; (2)跨事件提示融合,注入相邻事件语义以进行后期细化。我们贡献了一个自行策划的提示套件,用于对多事件生成进行基准测试,即 Meve。与其他 无需训练 方法相比,TunerDiT 在 8 个指标上实现了最先进的性能,并在视频一致性和事件分离之间提供了可调的权衡。文本对齐的改进随着事件计数的增加而增加,表明随着事件计数的增加而扩展的可能性。