论文
GRNEdit:从生成细化网络中新的二进制证据角度进行高效的通用视频编辑
GRNEdit: Efficient General Video Editing from a New Binary-Evidence Perspective in Generative Refinement Networks
摘要
基于指令的通用视频编辑旨在将不同的编辑操作统一在一个直观的界面中。现有方法通常依赖于资源密集型调节,使用重量级分支或昂贵的源串联。有没有有效的方法来建模编辑意图?因此,我们引入了 GRNEdit,一个轻量级的两阶段框架。 GRN 通过位组合对视觉语义进行编码,从而启发了我们的方法。通过特定于任务的 微调,我们进一步采用这种表示形式,并将编辑语义重新构建为对各个位的本地保留或翻转决策。因此,源信息被建模为支持观察到的二元状态的坐标证据,而 GRN 主干仍然负责将其全局组成解析为连贯的生成语义。在第一阶段,紧凑编码器将离散源代码转换为连续证据信号,GRN 在整个二进制细化过程中吸收这些信号。受到无分类器指导的空提示训练的启发,我们进一步为空条件分配了特定于编辑的含义:空指令表示没有编辑,并通过源重建进行监督。这种身份路径不仅隐式地加强了第一阶段的证据利用和内容保存,而且还在与编辑状态相同的表示空间中产生了源保留状态。因此,第二阶段可以直接将每个编辑状态与其源保留对应状态进行比较,并利用它们的差异来修改未解决的目标位决策。 GRNEdit-2B 和 GRNEdit-8B 仅在 0.6M 对且条件参数少于 3\% 的情况下进行训练,在 OpenVE-Bench 上的得分分别为 4.03 和 4.18。 2B 模型的性能优于多个 14B 开源编辑器,而 8B 模型的性能与领先的开源编辑器相当。