论文
VINCIE-NExT:通过上下文建模解锁图像视频编辑
VINCIE-NExT: Unlocking Video Editing from Images via In-Context Modeling
摘要
构建一个功能强大的视频编辑器仍然比视频生成器困难得多:编辑需要(源、指令、编辑)三元组,注释成本高昂且难以大规模合成,而图像编辑已经成熟,有数百万个这样的对可用。在这项工作中,我们引入了 VINCIE-NExT,这是一个统一的框架,可通过上下文中的视觉演示将编辑功能从图像转移到视频,从而减轻对大规模配对视频编辑数据的需求。 VINCIE-NExT 将视频编辑分解为可组合子任务的结构化链(视频 -> 图像 -> 图像 -> 视频),通过图像域路由编辑意图,并在统一的扩散目标下实现异构图像和视频语料库的可扩展联合训练。由模型合成或由用户提供的图像编辑对被预先设置为上下文中的视觉演示,充当每个输出帧的空间外观蓝图。为了跨交错上下文进行地面外观编辑,我们引入了 新颖的位置编码将图像演示和视频帧链接在共享空间坐标系中,从而能够将外观变化忠实地传播到每个输出帧。编辑链进一步提供了有原则的测试时间扩展:通过将子任务链作为渐进扩散阶段执行,可以通过投资额外的计算来提高编辑质量,而无需重新训练。 OpenVE-Bench 上的综合实验展示了不同编辑类别的最先进性能,并通过消融确认了每个组件的有效性。