论文

一位编辑器,多次编辑:用于多样化视频编辑的统一 无需训练 框架

One Editor, Many Edits: A Unified Training-Free Framework for Diverse Video Editing

模型推理解码与生成控制

摘要

视频编辑跨越不同的编辑范式,但在单一统一框架内实现高质量的指令引导和主题引导编辑仍然具有挑战性。我们介绍了 EditVid,这是一个 无需训练 框架,它结合了用于局部连贯性的稀疏因果记忆、用于远程身份保存的基于对应的后注意词元注入以及用于编辑局部性的软潜在混合。同一框架支持指令引导和参考引导编辑,包括样式转换、属性修改、对象插入、部分级编辑和主题替换。在 FiVE 上,EditVid 获得了 78.16 FiVE-Acc,而最强评估的 无需训练 基线为 58.95,同时在 IVEBench 上获得了有竞争力的结果。一项用户研究进一步显示,与 7 种竞争方法相比,EditVid 的整体偏好率为 51.8%。