论文

StellarTTS:用于低延迟和鲁棒语音合成的稀疏时间嵌入

StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis

应用与实践内容创作

摘要

鲁棒性、延迟和韵律之间的权衡对文本转语音 (TTS) 系统提出了严峻的挑战。自回归模型尽管保真度很高,但速度缓慢且容易出错;非自回归(NAR)替代方案虽然速度快,但通常会通过严格的对齐方式牺牲韵律的自然性。本文介绍了 StellarTTS,这是一种基于稀疏时间嵌入策略的新型移动优化 NAR TTS 框架,可对音素持续时间、发音和韵律进行精细控制。此外,我们提出了一种语义感知编解码器,可以促进高效的单阶段解码。以稀疏时间嵌入为条件,我们的 83M 参数轻量级屏蔽生成 Transformer 实现了 0.08 的实时因子 (RTF)。实验表明,与最先进的 TTS 系统相比,StellarTTS 具有更低的延迟和更强的鲁棒性,同时在音频质量、韵律自然度和说话人相似度方面保持有竞争力的性能。