论文

ChordVideo:通过低能量传输进行一步式、无需训练、时间一致的视频编辑

ChordVideo: One-Step, Training-Free, Temporally Consistent Video Editing via Low-Energy Transport

模型推理解码与生成控制

摘要

一步式文本到图像模型可实现 无需训练,只需 1--2 次网络功能评估 (NFE) 即可进行无反转编辑,而 ChordEdit 通过沿采样时间进行低能量平滑来稳定此类编辑。然而,独立应用于视频帧时,它会产生时间闪烁和编辑强度漂移。我们引入了 \textbf{ChordVideo},它通过共享噪声、每帧 Chord 场的运动对齐因果聚合以及可选的时间平滑近端校正,将相同的低能量原理扩展到视频时间。我们得出了一个扭曲误差界限,它将运动偏差与随机闪烁分开,并预测较大时间窗口的收益递减。在具有两个单步主干的 TGVE/DAVIS 上,ChordVideo 将扭曲误差减少 \textbf{78\%},将闪烁减少 \textbf{49\%},将 CLIP 帧一致性提高 \textbf{9--10 点},并将背景 PSNR 增加约 \textbf{1.5,dB},同时保留 \textbf{2 NFE/frame}。与七个多步骤编辑器相比,它使用每个剪辑少 \textbf{10--60$\times$ 的模型步骤来实现有竞争力的时间一致性和源保存