论文

通过梯度逆优化,从冻结TTS模型中提取声音风格

Extracting Voice Styles from Frozen TTS Models via Gradient-Based Inverse Optimization

应用与实践内容创作

摘要

一些文本转语音系统提供了合成模型和预设风格向量,但保留了将录音转换为风格向量的参考编码器,因此用户无法获得新语音的风格。我们通过梯度下降反转已释放的管道,在没有编码器的情况下恢复该向量:所有权重保持冻结,只有样式向量根据目标一次记录的时间池 WavLM 统计数据进行优化。目标丢弃时间轴,因此不需要记录。版本中的两个限制使结果成为一种直接风格:音色风格的每一行都保留在预设所在的单位球体上,而时间池损失无法看到的小持续时间风格适合录音的语速。在 SupertonicTTS 上,超过 147 个说话者和每个 100 个保留句子,ECAPA-TDNN 相似度从 0.129 上升到 0.419,每个恢复的风格都从预设开始,结束时比预设更接近其目标,并且合并的单词错误率保持低于预设的错误率。验证者在其等误差点接受 52% 的恢复语音作为目标说话者,而预设的则为 1%。