论文
Phoenix TTS:通过流程匹配驱动的语音标记化进行高保真合成和语音转换
Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization
摘要
在当前的零样本文本到语音系统中,传统的语义标记器通常使用监督自动语音识别或自监督学习目标进行优化。然而,由于语音的固有性质,语义和声学信息无法完全解耦,基于 ASR 的分词器会丢弃声学细节以专注于语言内容;依赖它们的模型通常很难实现最佳的说话人相似度。此外,这些标记器是独立优化的,缺乏下游声学生成任务的直接监督。这种孤立的训练在提取的离散标记和声学模型所需的连续空间之间产生了特征差距,从根本上限制了合成质量的上限。为了弥补这一差距,我们提出了 Phoenix TTS,这是一个将表示学习与生成声学建模紧密结合的统一框架。具体来说,我们的语音标记器经过优化,可以重建自监督特征,以保持语义丰富性,同时接收来自流匹配训练损失的直接监督。通过这种联合训练范例,提取的离散标记成功地保留了必要的语义信息,并与下游流匹配模型的特征空间本地对齐。综合评价凸显了凤凰TTS的效率和效果。经过 11 万小时的数据训练,该系统实现了出色的语音清晰度,产生的 WER 始终低于 真值 录音。同时,它保持了强大的零样本说话者相似性,可以与几个著名的大规模基线相媲美或优于它们。此外,作为这种统一训练的有利副产品,学习的分词器可以无缝地适应零样本语音转换任务,而不需要特定于任务的 微调。