论文
FC-TTS:从两段参考语音独立控制风格与音色
FC-TTS: Style and Timbre Control in Zero-Shot Text-to-Speech with Disentangled Speech Representations
摘要
零样本文本转语音 (TTS) 的最新进展使得能够在说话风格和说话者音色方面准确模仿参考语音。然而,从单独的参考参考语音中实现对这些方面的分离控制仍然是一项具有挑战性的任务。一些研究提出了解缠结的语音表示,将语音分解为可解释的属性(例如音色、韵律和内容),为通过单独参考进行属性控制的 TTS 提供了有前景的基础。然而,如何有效地将这些表征集成到TTS系统中以实现独立和精确的控制仍有待探索。在本文中,我们提出了 FC-TTS,这是一种零样本 TTS 框架,可以通过调节两个不同的参考话语来实现风格和音色的分离控制。与继承了预训练解缠表示的局限性的现有系统不同,FC-TTS 引入了关键设计策略,包括架构选择、训练框架和辅助训练目标,从而提高了属性分离和双参考控制的可靠性。实验表明,FC-TTS 实现了高保真合成和有竞争力的零样本自然度,同时独特地支持风格和音色的一致和独立的操纵。音频样本可在 https://qualcomm-ai-research.github.io/fc-tts 获取