论文
Sparkle:通过解耦引导实现生动的指令引导视频背景替换
Sparkle: Realizing Lively Instruction-Guided Video Background Replacement via Decoupled Guidance
摘要
近年来,Senorita-2M 等开源项目推动了视频编辑向自然语言教学方向发展。然而,当前公开的数据集主要侧重于本地编辑或风格转移,这在很大程度上保留了原始场景结构并且更容易扩展。相比之下,背景替换是电影制作和广告等创意应用的核心任务,需要合成全新的、时间一致的场景,同时保持准确的前景-背景交互,这使得大规模数据生成更具挑战性。因此,由于缺乏高质量的训练数据,这项复杂的任务在很大程度上仍未得到充分探索。这种差距在性能不佳的最先进模型(例如 Kiwi-Edit)中很明显,因为包含此任务的主要开源数据集(即 OpenVE-3M)经常产生静态、不自然的背景。在本文中,我们将这种质量下降追溯到数据合成过程中缺乏精确的背景指导。因此,我们设计了一个可扩展的管道,通过严格的质量过滤以解耦的方式生成前景和背景指导。在此管道的基础上,我们引入了 Sparkle(一个包含约 14 万视频对的数据集,涵盖五个常见的背景更改主题)以及 Sparkle-Bench(迄今为止为背景替换量身定制的最大评估基准)。实验表明,我们的数据集和在其上训练的模型在 OpenVE-Bench 和 Sparkle-Bench 上实现了比所有现有基线更好的性能。我们提出的数据集、基准测试和模型在 https://showlab.github.io/Sparkle/ 上完全开源。