论文
从草稿到无需草稿:通过特权蒸馏与快速植入实现一步视频物体移除
From Draft to Draft-Free: One-Step Video Object Removal via Privileged Distillation and Fast Planting
摘要
视频对象去除是视频编辑中一项基本但具有挑战性的任务。尽管最近取得了进展,但现有方法通常分为两类。基于光流或注意力机制的传统方法通常会引入明显的伪影并产生不自然的结果。相比之下,基于扩散的方法提高了视觉真实感,但需要多个去噪步骤,限制了其实用性。为了解决这些问题,我们提出了 From-Draft-to-Draft-Free (D2DF),这是一种框架,可以将粗草稿转换为精细视频的能力提炼为一步视频生成模型。在 D2DF 中,训练教师模型通过多个步骤将低质量去除结果(“草稿”)细化为高保真视频。然后,通过优先特权一致性 蒸馏 (PPCD),我们将这一功能提炼到一个学生模型中,该模型根据草稿执行一步删除。为了消除草稿依赖性,我们引入了一种基于时间蒙版 Transformer 的自引导快速种植 (SGFP) 模块,该模块可在潜在空间中自动生成场景一致的伪草稿,从而实现完全无草稿的一步模型。大量的实验表明,草稿条件和无草稿版本都在多个指标上实现了最先进的性能,在质量和效率上都超越了传统的多步骤生成方法。单个视频的去噪过程仅需约1秒。