论文
MSEditor:实现一致的多镜头视频编辑
MSEditor: Toward Consistent Multi-Shot Video Editing
摘要
在本文中,我们解决了对多镜头视频序列执行一致、统一修改的问题。这项任务特别具有挑战性,因为多镜头视频由不连续的时间段组成,这些时间段在视点、摄像机比例和主体姿势方面变化很大,导致严重的身份漂移和累积错误传播。实现连贯的编辑需要建立可靠的跨镜头语义意识,以在这些脱节的边界上保持稳定的主题外观和视觉连续性。为了解决这个问题,我们提出了 MSEditor,这是第一个专为一致的多镜头视频编辑而设计的框架。为了克服高质量多镜头训练数据的稀缺性,我们重新利用现有的多视图视频数据集以提供强大的交叉镜头监督。在架构上,我们引入了一个监督适配器,它将交叉镜头信息注入到扩散主干中,使模型能够学习身份一致的表示。此外,为了有效减少累积错误并确保长程时间一致性,我们设计了一种交叉镜头打包策略,该策略可动态聚合自注意力窗口内语义相关镜头的信息。大量实验表明,在我们策划的多镜头视频编辑基准测试中,MSEditor 在身份保留、时间稳定性和整体视觉质量方面显着优于现有方法。