论文

Foley-Omni:从任务级音频合成到完整视频配乐生成的统一多模态生成模型

Foley-Omni: A Unified Multimodal Generation Model from Task-Level Audio Synthesis to Complete Video Soundtrack Generation

应用与实践内容创作

摘要

最近的统一音频生成模型可以支持语音、音效和音乐等多种任务,但大多数模型仍然专注于孤立的任务级合成。然而,真实的视频制作通常需要为同一视频联合且一致地生成完整音轨的多个组件。我们提出了 Foley-Omni,这是一种统一的多模态音频生成模型,通过在共享的潜在生成过程中联合建模语音、音效和音乐,将孤立的任务级合成扩展到完成视频配乐生成。为了支持训练和可重复的评估,我们开发了视听数据管理管道,并引入了 V2ST-Bench,这是整体视频配乐生成评估的基准。实验表明,Foley-Omni 在各个合成任务上与专家系统相比取得了具有竞争力的性能,同时提高了混合音轨生成的语音清晰度、视听一致性和感知质量。