论文

VoiceDesigner:统一声音生成与编辑的扩散框架

VoiceDesigner: Text-to-Voice Generation and Editing via Unified Diffusion Modeling and Data Augmentation

模型架构Transformer

摘要

生成模型的最新突破使得文本到语音生成(TTV)成为可能,从而能够直接从文本语音描述合成语音。然而,现有系统面临两个关键挑战。首先,他们努力生成各种声音,涵盖现实世界中的人类说话者和虚构人物。其次,它们缺乏强大而灵活的语音编辑功能,例如语音克隆以及修改情感和语气等属性的能力。在本文中,我们提出了 VoiceDesigner,一个用于文本到语音生成和编辑的统一框架,支持多样化且可控的语音设计。针对上述挑战,我们从两个角度提出解决方案。首先,我们开发了一个混合数据管道,利用数字信号处理技术和语音生成模型来构建涵盖真实世界和虚构声音的多样化语音数据集。其次,我们引入了扩散 Transformer,其架构经过改进,可以更好地处理复杂的调节并增强多任务性能,从而实现统一的语音生成和编辑。通过主观和客观评估,VoiceDesigner 实现了与语音描述和编辑指令的卓越提示对齐,同时与最先进的 TTV 模型相比,保持了有竞争力的感知质量和语音可用性。