论文
VicEdit:学习从视觉上下文示例中编辑视频
VicEdit: Learning to Edit Videos from Visual In-Context Examples
摘要
尽管基于指令的视频编辑取得了进展,但单模态文本指令本质上难以传达细粒度的纹理和复杂的动态。为了弥合这种感知差距,我们提出了视觉上下文编辑,这是一种将视频编辑从文本指令提升到包含单个图像、图像对和视频对的多模式视觉指导的新范例。为了促进这一范例,我们策划了 VicEdit-400K,这是第一个用于可视化上下文视频编辑的大型数据集。我们开发了一个自动化管道,可在十种任务类型中生成 40 万个高质量样本,通过多维过滤确保卓越的视觉保真度和语义一致性。利用这个基础,我们引入了 VicEdit,一个连接视觉和文本上下文的统一框架。为了从异构参考中自适应地提取编辑语义,我们设计了模态自适应语义 蒸馏,它从视觉参考中生成特定于模态的语义标记。然后,这些词元通过双上下文注入与文本指令协同集成,使生成过程能够从视觉和文本信号中受益。对 VicEditBench 的广泛评估表明,VicEdit 在基本指令编辑和视觉上下文编辑任务中均实现了最先进的性能,将视觉上下文学习建立为强大且可控的视频编辑范例。