论文
FineCombo-TTS:结合文字描述与参考语音的精细可控合成
FineCombo-TTS: Collaborative and Precise Controllable Speech Synthesis Using Text Descriptions and Reference Speech
摘要
可控文本转语音(TTS)已成为重点研究热点。然而,基于参考语音或文本描述的方法缺乏灵活性和精确控制,并且最近的联合方法仍然松散耦合,语音建模音色和文本控制全局风格。我们提出了 FineCombo-TTS,这是一种以参考语音为基础、以文本描述为指导的语音合成统一框架,能够灵活、精确地控制声学属性。我们学习统一的声学表示,并引入基于条件流匹配(CFM)的语音变化预测器,以对由文本描述引导的细粒度参考目标转换进行建模,而不是显式属性解耦。为了支持相对属性控制,我们构建了 FineEdit,这是一个结构化的配对数据集,它显式编码源到目标的属性变化。实验表明,我们的方法实现了灵活、精确、富有表现力的可控 TTS。