论文

动态激活干预提升噪声环境中的语音清晰度

Loud and Clear: Dynamic Activation Steering for Improving Speech Intelligibility in Noisy Environments

模型推理解码与生成控制

摘要

在嘈杂的环境中,语音变得不太清晰,人类会自然地调整自己的声音来进行补偿。受这种行为的启发,我们研究是否可以使用激活引导来引导文本转语音(TTS)模型产生更容易理解的语音,而无需重新训练。我们关注伦巴第效应的两个特征:发声力度增加和发音过度。我们引入了一种与提示相关的转向机制,可以防止转向效果在生成过程中累积,同时允许动态调整其强度。对于见过和看不见的说话者以及多种语言,我们的方法会产生与 Lombard 相关的声学特征的系统变化,保留说话者相似性 (89-95%),并在 1 dB SNR 的背景噪声下将 WER 降低 7-22%。这些结果表明,可以动态控制预训练的 TTS 模型,以生成更容易理解的语音,而无需重新训练。

动态激活干预提升噪声环境中的语音清晰度:论文原图
图 2:动态引导语音的特征。突出显示的部分对应于施加引导的窗口。