论文
SwanVoice:用于独白和对话的富有表现力的长格式零样本语音合成
SwanVoice: Expressive Long-Form Zero-Shot Speech Synthesis for Both Monologue and Dialogue
摘要
零样本文本转语音 (TTS) 在单说话人合成方面已得到显着改善,但富有表现力的长篇多说话人对话仍然很困难。常见的解决方法是使用独白 TTS 模型合成每个回合,并将输出拼接在一起。这增加了推理成本,并且经常破坏声音一致性、对话连贯性和回合间的情感连续性。最近的对话 TTS 系统已经开始解决这一问题,但它们仍然难以同时保持表达的连贯性、可控的说话者切换和独白质量。我们推出 SwanData-Speech 和 SwanVoice。 SwanData-Speech 从野外音频构建独白和对话语料库,使用 Swan Forced Aligner 进行暂停感知的单词级对齐,并使用 RobustMegaTTS3 处理发音困难的情况。基于这些数据,SwanVoice 是一个适用于 1--4 个说话人的零样本 TTS 模型,结合了 25 Hz VAE、具有暂停感知符号和拼音替换的原始文本调节,以及具有说话人转动调节的流量匹配 DiT。训练从独白语音开始,经过混合和真实的对话数据,然后使用 DiffusionNFT 后训练 以及电话级别和说话人相似性奖励。在 SwanBench-Speech 上,SwanVoice 在独白和对话设置中获得了比所有评估的开源基线更高的丰富度和层次分数,但内容准确性仍然是主要限制。音频演示可在 https://swanigc.github.io//#swanvoice 获取。