论文
VOID:视频对象和交互删除
VOID: Video Object and Interaction Deletion
摘要
现有的视频对象去除方法擅长修复对象“后面”的内容并纠正阴影和反射等外观级伪影。然而,当移除的对象具有更重要的交互作用时,例如与其他对象的碰撞,当前模型无法纠正它们并产生令人难以置信的结果。我们推出了 VOID,一个视频对象删除框架,旨在在这些复杂的场景中执行物理上合理的修复。为了训练模型,我们使用 Kubric 和 HUMOTO 生成一个新的反事实对象删除配对数据集,其中删除对象需要改变下游物理交互。在推理过程中,视觉语言模型会识别场景中受移除对象影响的区域。然后,这些区域被用来指导视频传播模型,生成物理上一致的反事实结果。对合成数据和真实数据的实验表明,与之前的视频对象去除方法相比,我们的方法在对象去除后更好地保持了一致的场景动态。我们希望这个框架能够揭示如何通过高级因果推理使视频编辑模型更好地模拟世界。