论文
从理解到擦除:迈向完整稳定的视频对象去除
From Understanding to Erasing: Towards Complete and Stable Video Object Removal
摘要
视频对象去除旨在擦除目标对象,同时重建视觉上合理且时间连贯的内容。然而,目标对象通常会产生阴影、反射、照明变化和其他超出所提供掩模范围的效果,使得传统的掩模条件完成容易产生可见的残差。因此,我们将副作用感知的对象移除制定为一个理解引导的过程,集成了对象-效果关系、受影响区域定位和上下文感知重建。具体来说,我们引入对象诱导关系 蒸馏 将 词元级 对象-效果关系从预训练的视觉基础模型转移到视频扩散模型。然后,我们设计了对象感知框架上下文交叉注意,将目标对象语义与每帧背景上下文相结合,以进行去除和重建,并提出注意引导区域定位,以导出目标对象及其受影响区域的软空间先验。跨多个基准的大量实验表明,我们的方法实现了更完整的对象和效果去除,并且在去除质量、副作用抑制和时间一致性方面优于现有方法。