论文

TripleFlow:通过桥接残留编辑和本机生成实现免训练视频对象删除

TripleFlow: Training-Free Video Object Removal by Bridging Residual Editing and Native Generation

模型推理解码与生成控制

摘要

视频对象删除提出了独特困难的编辑挑战。由于删除提示仅指定要擦除的内容而不是要生成的内容,因此模型必须完全从周围的上下文中推断和重建高度特定的遮挡背景。现有的免训练方法很难解决这个问题,因为它们的编辑机制主要充当局部橡皮擦。他们无法主动合成缺失的背景细节,并且经常留下重影伪影。为了解决这个问题,我们提出了 TripleFlow,一种将擦除和生成紧密耦合的免训练框架。它在整个过程中协调源流、残余流和合成流。通过重用单个目标预测,残差流隔离并抑制对象,而合成流独立地重建被遮挡的背景。至关重要的是,TripleFlow 在每一步都会将这种新合成的背景注入到编辑轨迹中。这种连续的反馈循环确保生成的结构主动指导移除过程,实现与未编辑场景在时空上一致的无缝完成。对五个具有挑战性的基准的广泛评估表明,TripleFlow 建立了一种新的最先进技术,在重建保真度和时间一致性方面显着优于现有基线。