论文

综合伦巴第效应:TTS 中语音清晰度和发声力度的多级控制

Synthesizing the Lombard Effect: Multi-Level Control of Speech Clarity and Vocal Effort in TTS

应用与实践内容创作

摘要

在充满挑战的环境中,例如嘈杂的环境或向听力受损的听众讲话时,人类往往会说得更大声、更清晰,这被称为伦巴第效应。为了在语音合成系统中模拟这种行为,我们引入了一种基于流匹配的文本到语音 (TTS) 模型,该模型使用声音效果和发音伪标签进行训练。所提出的模型实现了对发声努力和发音的连续且解开的控制,同时还能够进行单词级强调以澄清话语的特定片段。实验结果表明,这些控制机制有效地改善了与清晰度相关的声学特征。此外,噪声中的语音实验表明,我们的模型成功模拟了噪声条件下人类清晰语音的清晰度增益。