论文

用于视频对象插入和视频层分解的显式层建模

Explicit Layer Modeling for Video Object Insertion and Video Layer Decomposition

模型评测基准与评测资源

摘要

大多数视频编辑系统仍然缺乏明确的分层视频表示,限制了真实合成、对象重用和一致操作。这种限制在视频对象插入和视频层分解中尤其明显,其中现有方法缺乏对捕获对象及其相关视觉效果的前景层的直接监督。我们引入了 TriLayer,一个三元组视频数据集,包含对齐的复合-背景-前景视频,其中前景层包括对象外观和相关的视觉效果。通过对齐的三元组监督,TriLayer 首次实现了分层视频表示的显式监督学习。在此数据集的基础上,我们提出了 DBL-Diffusion,这是一种双分支扩散框架,可在去噪过程中通过跨分支交互对场景级 RGB 内容和 RGBA 前景层进行联合建模。我们在两个任务中实例化该框架:用于分层对象插入的 DBL-Insert,它生成用于逼真合成和灵活后期编辑的显式 RGBA 层,以及用于视频层分解的 DBL-Decompose,它使用三元组监督恢复前景和背景层。实验表明,显式层建模大大提高了插入保真度和分解质量。