论文

海绵宝宝:同步感知和谐视听生成编辑

SpongeBob: Sync-Aware Harmonious Audio-Visual Generative Editing

应用与实践内容创作

摘要

物理世界中的视觉和听觉事件本质上是耦合的,但现有的视频编辑方法通常采用解耦的管道,缺乏双向模态交互。这导致两个关键限制:(i) 视听不同步和 (ii) 生成的音频和保留的内容之间的上下文冲突。为了解决这些问题,我们提出了海绵宝宝,这是第一个具有双向跨模态交互的端到端视听联合编辑框架。为了实现同步,同步感知机制通过双向注意、时间对齐和空间约束将视觉编辑与声音事件对齐。为了实现上下文一致性,上下文感知模块利用声音和视觉上下文注意力来防止语义冲突。此外,我们引入了同步保持训练和指导 (SPTG),以在不降低质量的情况下增强对齐。由于配对数据的稀缺,我们构建了一个可扩展的数据管道和一个大规模的主题级数据集。我们还提出了 SpongeBob-Bench 进行系统评估。实验表明 SpongeBob 的性能显着优于现有基线,将 Sync-C 提高了 30%,将 Ctx-F1 提高了 12.5%。我们的项目页面位于:https://hy-spongebob.github.io/。