论文

从可靠的文本到真实的声音:针对低资源 TTS 的信任感知渐进式适应

From Reliable Text to Real Voices: Trust-Aware Progressive Adaptation for Low-Resource TTS

模型训练监督微调与指令调优

摘要

低资源文本到语音(TTS)的适应受到稀缺的配对数据和昂贵的手动转录的限制。现有的固定语音 TTS 系统可以提供相对准确的发音,但其合成语音提供的说话者多样性有限,并且可能表现出平淡的韵律。真实录音提供自然的韵律和多样化的声音,但其自动语音识别 (ASR) 伪标签可能包含转录错误。我们发现监督顺序会影响内容准确性和说话者相似度。我们提出信任感知的渐进适应:合成到真实的适应首先建立文本-语音对应,然后使用真实语音恢复参考说话者控制。转录协议加权使用两个固定 ASR 系统之间的协议作为伪标签可靠性的代理,以限制噪声监督。在缅甸语和老挝语上使用 FireRedTTS3 以及在缅甸语上使用 OmniVoice 进行的实验表明,内容准确性得到了提高,具有高度自然度和竞争性说话人相似性。在结合合成语音和真实语音时,共同考虑监督顺序和伪标签可靠性,为低资源语言中的零样本语音克隆提供了一条实用的途径,需要更少的手动转录。音频演示可在此 https URL 获取