论文
LIVE:利用图像处理先验进行基于指令的视频编辑
LIVE: Leveraging Image Manipulation Priors for Instruction-based Video Editing
摘要
视频编辑旨在根据用户意图修改输入视频。最近,端到端的训练方法引起了广泛的关注,通过视频生成或编辑模型构建配对视频编辑数据。然而,与图像编辑相比,当依赖视频生成模型或手动标注时,视频数据的高标注成本严重限制了视频编辑数据集的规模、质量和任务多样性。为了弥补这一差距,我们提出了 LIVE,这是一个联合训练框架,利用大规模、高质量的图像编辑数据和视频数据集来增强编辑能力。为了减轻静态图像和动态视频之间的域差异,我们引入了逐帧标记噪声策略,该策略将特定帧的潜在特征视为推理标记,利用大型预训练视频生成模型来创建合理的时间转换。此外,通过清理公共数据集和构建自动化数据管道,我们采用两阶段训练策略来退火视频编辑能力。此外,我们还策划了一个全面的评估基准,涵盖 60 多个具有挑战性的任务,这些任务在图像编辑中很常见,但在现有视频数据集中很少。广泛的比较和消融实验表明我们的方法实现了最先进的性能。源代码将公开。