论文
AutoSIFT:自动风格筛选,通过任意风格填充实现可控语音生成
AutoSIFT: Automatic Style Sifting for Controllable Speech Generation with Arbitrary Style Infilling
摘要
最先进的文本转语音 (TTS) 模型实现了令人印象深刻的自然度和表现力,但对说话风格的细粒度、解开的控制仍然具有挑战性。在电影配音、游戏配音、视频内容生成等专业场景中,用户常常需要修改特定的风格类别,例如情感、年龄或性别,同时保留所有其他风格类别。现有的风格可控 TTS 方法通常依赖于文本描述的风格或语音参考风格传输,这使得难以联合控制显式语义属性并保留微妙的、文本未描述的韵律细节。我们提出了 AutoSIFT,一种用于类别级样式编辑的可控语音生成框架。 AutoSIFT 将说话风格分解为已知的文本可描述类别和未知的残留风格,以捕获非语言韵律和说话者特定的细微差别。它由广义的风格解缠器和任意风格填充器组成,前者从参考语音中提取类别感知的风格原型,后者有选择地从参考中填充未指定的风格类别。通过仅替换文本指定的样式类别,同时保留剩余的语音派生样式,AutoSIFT 可以生成自然、富有表现力且高度可定制的语音。