论文
通过语音特征调节实现无转录文本到语音的流程匹配
Transcript-Free Flow-Matching Text-to-Speech via Speech Feature Conditioning
摘要
最近的流匹配文本到语音 (TTS) 模型(例如 F5-TTS)依赖于从外部 ASR 系统获得的推理时参考转录本。这种依赖性使得零样本 TTS 对于有口音或构音障碍的说话者来说很脆弱,而这正是最需要它的场景。此外,我们发现基于文本的参考调节可以将非典型声学模式从非典型语音传播到合成中,即使 真值 转录本可用。为了解决这个问题,我们提出了 RTFree-F5,它用通过轻量级适配器映射到 F5-TTS 文本调节空间的连续自监督语音表示替换了参考转录本,同时重用了预训练的检查点。在构音障碍语音方面,RTFree-F5 将 WER 从 24.6% 降低至 10.4%,甚至超过了 真值 参考转录本基线,同时提高了自然度并在标准基准上保持竞争力,而无需任何参考转录本。