论文
FlowLong:通过流形约束 Tweedie 匹配生成推理时间长视频
FlowLong: Inference-time Long Video Generation via Manifold-constrained Tweedie Matching
摘要
将视频扩散模型的生成范围扩展到长序列仍然是一个长期存在的重要挑战。现有的 无需训练 方法分为两类:双向模型的扩展,它与特定架构紧密耦合,并且在长期范围内会遭受质量下降;以及自回归模型,它会由于曝光偏差而累积漂移误差,并倾向于产生重复的运动模式。为了解决这些问题,我们提出了一种新颖但简单的长视频生成推理时间方法,该方法与架构无关,不需要额外的训练。我们的方法通过重叠滑动窗口生成长视频,其中来自相邻窗口的预测干净样本通过 emph{Tweedie 匹配} 进行混合,以在重叠区域之间强制执行 \textbf{流形约束和时间一致性}。 \emph{随机早期阶段采样}然后通过在高噪声阶段的每次 Tweedie 匹配校正后注入新噪声来同步每个窗口的轨迹,然后过渡到确定性 ODE 采样以保持细粒度的视觉保真度。应用于各种视频生成模型,我们的方法生成的视频比原生窗口长度长几倍,同时在时间一致性和视觉质量方面优于 无需训练 和自回归基线,并进一步扩展到音视频联合生成和文本到 3DGS,而无需任何 微调。