论文
SemaVoice:语义感知连续自回归语音合成
SemaVoice: Semantic-Aware Continuous Autoregressive Speech Synthesis
摘要
连续自回归语音合成最近已成为零样本文本转语音(TTS)的一个有前途的方向。然而,现有方法仍然存在语义韵律建模和重建驱动的连续语音表示之间根本不匹配的问题。这种不匹配导致 TTS 模型过度关注低级声学纹理,而牺牲高级语义一致性,进一步加剧自回归生成中的错误累积。为了应对这一挑战,我们提出了 SemaVoice,这是一种用于高保真零样本 TTS 的语义感知连续自回归框架。 SemaVoice 引入了语音基础模型 (SFM) 引导对齐机制,可细化连续语音表示,以更好地捕获局部语义一致性和全局结构关系。这些表示在自回归框架内调节了补丁式扩散头,以实现高质量的语音合成。 Seed-TTS 基准测试的实验结果表明,SemaVoice 的英语 WER 为 1.71\%,在客观和主观评估方面与最先进的开源系统保持着高度竞争力。 SFM 引导对齐的有效性通过在具有固定信息速率约束的不同表示粒度下的显着改进得到进一步证实。