论文

通过多视图先验的可控视频对象插入

Controllable Video Object Insertion via Multi-View Priors

应用与实践内容创作

摘要

视频对象插入将用户指定的对象放置在现有的动态场景中。现有方法通常以文本或单个参考图像为生成条件。因此,对象外观在视点变化下受到约束,通常会导致身份漂移、不正确的前景-背景分层、边界伪影和时间闪烁。在本文中,我们提出了一种视频对象插入框架,该框架结合了多视图对象先验来解决这些限制。该框架将 2D 参考图像提升为多视图表示,并使用视图一致调节来提供稳定的身份引导和视图自适应外观线索。质量感知加权机制可减少噪声或不完美的重建视图的影响。我们进一步引入了集成感知一致性模块,该模块可促进合理的遮挡、清晰的边界和时间连续性。实验表明,与基线方法相比,所提出的框架提高了视频对象插入的视觉质量、可控性、身份一致性和前景-背景集成。项目页面:https://polarisxq.github.io/MOVI/。