论文
Dasheng AudioGen:从文本生成连贯音频场景的统一模型
Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text
摘要
音频生成长期以来都是支离破碎的,特定领域模型产生的语音、音乐和音效无法从单一描述中联合生成连贯的音频场景。主要障碍是对现实世界混合音频的细粒度监督不足,以及对并发音频组件建模的声学表示有限。我们推出了 Dasheng AudioGen,一个用于从文本生成通用混合音频场景的统一框架。 Dasheng AudioGen 引入了结构化多视图描述文本,将复杂的声学场景明确解耦为互补的描述视图,从而实现对音频层的细粒度控制。此外,我们采用高维统一语义声学表示作为共享潜在空间。它注入了促进跨模式训练收敛的语义先验,而其高维特征空间提供了足够的能力来有效地解开和融合并发音频组件。通过这些设计,简单的流程匹配 DiT 即可实现高质量的端到端音频场景生成。我们还建立了音频场景生成的综合评估流程。实验表明,大声 AudioGen 在混合音频类别中实现了接近真实世界录音的性能,同时在单一类型生成任务中与专用模型保持竞争力。演示可在 https://nieeim.github.io/Dasheng-AudioGen-Web/ 获取。