论文

SEDiT:一步扩散 Transformer 实现无掩码视频字幕擦除

SEDiT: Mask-Free Video Subtitle Erasure via One-step Diffusion Transformer

应用与实践内容创作

摘要

最近视频扩散模型的突破极大地加速了视频编辑技术的发展。然而,现有方法往往依赖于基于掩码输入的视频帧修复,这需要提前提取目标视频掩码,分割的精度直接影响完成的质量。在本文中,我们提出了 SEDiT,这是一种通过一步扩散 Transformer 的新型单阶段视频字幕擦除方法。我们引入了一种无掩码推理方法,可以直接擦除目标字幕。所提出的一阶段框架减轻了先前模型的两阶段处理中固有的次优性。由于字幕删除是一项局部编辑任务,其中大多数像素保持不变,因此底层分布变化很小,使其非常适合在整流下的一步生成。我们凭经验验证了一步去噪的可靠性,并进一步提供了正式的理论依据。在字幕去除的局部编辑结构下,条件最优传输(OT)映射及其诱导的整流速度场相对于潜变量是Lipschitz连续的,这支撑了一步采样的理论可行性。为了解决长期时间一致性的挑战,我们采用混合训练策略,偶尔用干净的第一帧潜在变量来调节模型。这有利于时间连续性,允许推理过程中的每个片段都利用其前一个片段的输出。为了避免因裁剪和重新插入处理过的目标而造成可见接缝,特别是在涉及大量运动的场景中,我们将原始视频直接输入 SEDiT。得益于一步和分块的流式推理,我们的方法可以有效地处理无限长度的原生 1440p 视频。