论文
增强无训练无限帧生成,实现一致的长视频
Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos
摘要
在不产生大量计算开销的情况下,免训练长视频生成旨在使基础视频生成模型能够生成更长的视频。帧级自回归框架(例如 FIFO 扩散)具有以恒定内存消耗生成无限长视频的优势。然而,训练和推理之间的不匹配,加上保持长期一致性的挑战,限制了基础模型的有效利用。为了减轻这些担忧,我们提出了 \textbf{MIGA},一种新颖的无限帧长视频生成方法。首先,我们提出了一种有效的两阶段对齐机制,通过减少输入模型的过多噪声跨度来缩小训练推理差距。然后,我们引入了一种创新的双重一致性增强机制,其中自反射方法纠正早期的高噪声帧,而远程帧引导方法利用后来具有广泛覆盖范围的低噪声帧来引导生成,共同提高时间一致性。 VBench 和 NarrLV 上的大量实验证明了 MIGA 的最先进性能。我们的项目页面位于 https://xiaokunfeng.github.io/miga_homepage/。