论文

看到的场景:保留看到的内容,生成视频外画中看不见的内容

Seen-to-Scene: Keep the Seen, Generate the Unseen for Video Outpainting

应用与实践内容创作

摘要

视频外画旨在将视频的可见内容扩展到原始帧边界之外,同时保持帧间的空间保真度和时间一致性。现有方法主要依赖于大规模生成模型,例如扩散模型。然而,基于生成的方法受到隐式时间建模和有限空间上下文的影响。这些限制导致帧内和帧间不一致,这在动态场景和大型外画场景中变得尤为明显。为了克服这些挑战,我们提出了 Seen-to-Scene,这是一种新颖的框架,它统一了基于传播和基于生成的视频绘制范例。具体来说,Seen-to-Scene 利用基于流的传播和针对视频修复预先训练的流完成网络,该网络以端到端的方式进行微调,以桥接域间隙并重建相干运动场。为了进一步提高传播的效率和可靠性,我们引入了参考引导的潜在传播,可以有效地跨帧传播源内容。大量的实验表明,我们的方法通过有效的推理实现了卓越的时间一致性和视觉真实感,甚至超越了之前需要针对输入进行调整的最先进方法。