论文

FoleyGenEx:具有多模态控制、时间对齐和语义精度的统一视频到音频生成

FoleyGenEx: Unified Video-to-Audio Generation with Multi-Modal Control, Temporal Alignment, and Semantic Precision

应用与实践内容创作

摘要

我们推出了 FoleyGenEx,这是一个统一的视频到音频 (VTA) 框架,集成了多模式控制、帧级时间对齐和细粒度语义,可为不同的任务实现同步、多功能的音频合成。现有的 VTA 方法要么具有多模态控制但时间对齐较弱,要么具有强对齐但缺乏参考音频调节和语义精度。 FoleyGenEx 通过三项核心创新填补了这一空白:用于音频控制 VTA 和 Foley 扩展的条件注入机制、保持训练同步的多模态动态掩蔽策略,以及利用信号处理和 大语言模型 来增强具有细微语义的文本监督的基于副词的数据增强算法。在 AudioCaps、VGGSound 和 Greatest Hits 上进行的实验证明了其可控 VTA 性能与现有方法相比具有竞争力。演示示例可从 https://foleygenex.github.io/FoleyGenEx 获取。