论文

UniSonate:带有文本指令的语音、音乐和音效生成的统一模型

UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions

应用与实践内容创作

摘要

生成音频建模主要分为专门的任务,文本到语音 (TTS)、文本到音乐 (TTM) 和文本到音频 (TTA),每个任务都在异构控制范例下运行。由于结构化语义表示(语音/音乐)和非结构化声学纹理(声音效果)之间存在内在的不和谐,统一这些模式仍然是一个基本挑战。在本文中,我们介绍了 UniSonate,这是一个统一的流程匹配框架,能够通过标准化、无参考的自然语言指令接口合成语音、音乐和音效。为了协调结构差异,我们提出了一种新颖的动态词元注入机制,将非结构化环境声音投射到结构化时间潜在空间中,从而在音素驱动的多模态扩散 Transformer (MM-DiT) 中实现精确的持续时间控制。结合多阶段课程学习策略,该方法有效缓解了跨模式优化冲突。大量实验表明,UniSonate 在基于指令的 TTS (WER 1.47%) 和 TTM (SongEval Coherence 3.18) 方面实现了最先进的性能,同时在 TTA 中保持了有竞争力的保真度。至关重要的是,我们观察到正迁移,与单任务基线相比,对不同音频数据的联合训练显着增强了结构连贯性和韵律表现力。音频样本可在 https://qiangchunyu.github.io/UniSonate/ 获取。