论文
OmniSonic:联合视频与文本生成完整音频场景
OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
摘要
在本文中,我们提出了通用整体音频生成(UniHAGen),这是一项用于合成全面听觉场景的任务,其中包括跨不同领域(例如环境事件、乐器和人类语音)的画面内和画面外声音。先前的视频调节音频生成模型通常专注于产生与可见发声事件相对应的画面内环境声音,而忽略画面外听觉事件。虽然最近的整体联合文本视频到音频生成模型旨在产生具有画面内和画面外声音的听觉场景,但它们仅限于非语音声音,缺乏生成或集成人类语音的能力。为了克服这些限制,我们引入了 OmniSonic,这是一种基于视频和文本联合条件的基于流匹配的扩散框架。它采用 TriAttn-DiT 架构,执行三种交叉注意操作,同时处理画面内的环境声音、画面外的环境声音和语音条件,并采用专家混合 (MoE) 门控机制,在生成过程中自适应地平衡它们的贡献。此外,我们构建了 UniHAGen-Bench,这是一个新的基准,拥有超过 1000 个样本,涵盖三种代表性的画面内/画面外语音环境场景。大量实验表明,OmniSonic 在客观指标和人类评估方面始终优于最先进的方法,为通用和整体音频生成建立了坚实的基线。项目页面:https://weiguopian.github.io/OmniSonic_webpage/