论文
OSVE:使用一步扩散模型的一步视频编辑
OSVE: One Step Video Editing with One Step Diffusion Models
摘要
使用扩散模型进行文本引导的视频编辑速度慢得不切实际,而且受到昂贵的多步采样和反演的阻碍。我们推出了 OSVE,这是第一个成功采用一步文本到图像 (T2I) 模型进行高质量视频编辑的框架,解决了反转、可编辑性和时间一致性的核心挑战。为了绕过缓慢的迭代反转,我们训练了一个可学习的编码器,该编码器可以预测单次前向传递中每个帧的初始噪声。该编码器在结构对齐图像对的精选数据集上使用新颖的结构感知编辑(SAE)损失进行训练,教导它在编辑过程中保留源视频的几何形状。为了时间连贯性,我们引入了统一帧编辑(UFE),这是一种连接帧潜在变量以促进单个生成步骤中的跨帧注意力的技术。此外,对于长视频,带有锚框的滑动窗口策略可以保持全局一致性。我们的大量实验表明,OSVE 的编辑质量可与最先进的多步骤方法相当或优于,同时运行速度提高约 155--171 倍。这一突破为实用的实时视频编辑应用铺平了道路。代码可在 https://github.com/KU-VGI/OSVE 获取。