论文
EffectLearner:用于现实世界视频对象移除的世界感知对象效果推理
EffectLearner: World-Aware Object-Effect Reasoning for Real-World Video Object Removal
摘要
视频对象去除不仅必须消除目标对象,还要消除其引起的影响,同时保持高保真和时空相干的恢复。现有的方法主要从预定义的效果类别和固定的数据分布中隐式地学习对象效果对应关系,限制了它们对涉及成分效果、空间分离或弱相关效果、长尾物理现象和动态演化交互的复杂现实世界场景的泛化。我们提出了 EffectLearner,这是一种语义推理增强框架,它将基于 VLM 的对象效果推理器与基于 DiT 的视频擦除器相结合。在结构化效果分析提示的指导下,Reasoner 对目标突出显示的视频执行跨模式推理,并提取紧凑的效果感知上下文,从而引导视频擦除器全面消除对象效果。运动感知掩模引导和运动一致性监督进一步提高了对象运动和不断变化的场景动态下的去除覆盖范围和时空稳定性。为了在具有挑战性的现实场景中充分利用该框架,我们进一步构建了 EffectWorld,一个专门为复杂对象引起的效果而设计的配对视频数据集,并引入了将常见监督与复杂效果数据相结合的渐进式训练课程。在标准 ROSE-Bench 上,EffectLearner 在大多数指标上都优于现有基准,并且在 EffectWorld-Eval 和具有挑战性的 EffectWorld-Wild 上都取得了明显的优势,展示了其在复杂的现实场景中提供高质量视频对象去除的能力。