论文
CrossEdit:通过跨模态训练实现组合音视频编辑
CrossEdit: Cross-Modal Training Enables Rich Audio-Visual Editing
摘要
多媒体编辑要求生成模型理解复杂的组合指令,并在不同模态中仅修改指定元素,已有系统大多尚不具备这项能力。当前方法通常限于单一模态中的简单、单属性编辑,因为多样且高质量的编辑对难以获取;跨模态任务尤其缺少对齐的音视频数据。我们提出CrossEdit,一个统一图像、音频和视频的全模态编辑模型,通过跨模态迁移实现电影场景的零样本音视频编辑。核心观察是:在任一模态中学得的复杂指令遵循能力,可以泛化到其他模态。我们利用声学信号的可叠加性,以程序方式生成带组合指令的大规模音频编辑对。结合这些合成数据、自监督音视频掩码重建,以及经过筛选的特定跨模态任务进行微调后,指令遵循能力可零样本迁移到未见过的模态与指令组合。为评估这项能力,我们开放人工标注的电影场景音视频编辑基准CrossEditBench,并提出联合评价指令遵循与一致性的AV-FES指标。所提技术提高了零样本电影场景音视频编辑表现,同时保持或改善口型同步语音编辑,以及常规图像、视频和音频编辑基准成绩。演示见https://wanchichen.github.io/crossedit/。
