论文
UAT:用于音频生成、编辑和字幕的统一音频文本扩散
UAT: Unified Audio-Text Diffusion for Audio Generation, Editing, and Captioning
摘要
音频生成和音频到文本的理解在很大程度上仍然是分开的,扩散模型主导高保真合成,自回归 (AR) 语言模型驱动字幕和语义预测。现有的统一方法通常依赖于异构模块或以 AR 为中心的建模,这可能会阻碍联合优化并限制声学保真度。据我们所知,我们提出了 UAT,这是第一个以传播为中心的框架,支持统一的音频生成、编辑和字幕。 UAT 将音频的连续潜在扩散与文本的屏蔽离散扩散相结合,从而在共享双流主干内实现双向音频-文本建模。实验表明,UAT 保留了强大的音频生成和编辑能力,同时实现了有竞争力的字幕性能,展示了声学合成和语义预测之间的良好平衡。演示示例可从 https://UAT-demo.github.io 获取。