论文

CrossEdit:通过跨模态训练实现组合音视频编辑

CrossEdit: Cross-Modal Training Enables Rich Audio-Visual Editing

模型训练应用与实践监督微调与指令调优合成数据内容创作

摘要

多媒体编辑要求生成模型理解复杂的组合指令,并在不同模态中仅修改指定元素,已有系统大多尚不具备这项能力。当前方法通常限于单一模态中的简单、单属性编辑,因为多样且高质量的编辑对难以获取;跨模态任务尤其缺少对齐的音视频数据。我们提出CrossEdit,一个统一图像、音频和视频的全模态编辑模型,通过跨模态迁移实现电影场景的零样本音视频编辑。核心观察是:在任一模态中学得的复杂指令遵循能力,可以泛化到其他模态。我们利用声学信号的可叠加性,以程序方式生成带组合指令的大规模音频编辑对。结合这些合成数据、自监督音视频掩码重建,以及经过筛选的特定跨模态任务进行微调后,指令遵循能力可零样本迁移到未见过的模态与指令组合。为评估这项能力,我们开放人工标注的电影场景音视频编辑基准CrossEditBench,并提出联合评价指令遵循与一致性的AV-FES指标。所提技术提高了零样本电影场景音视频编辑表现,同时保持或改善口型同步语音编辑,以及常规图像、视频和音频编辑基准成绩。演示见https://wanchichen.github.io/crossedit/。

CrossEdit:通过跨模态训练实现组合音视频编辑:论文原图
图 2:编码 AV 数据时的 CrossEdit 架构。为简单起见,我们省略了图像,将其视为单帧视频的特例。