论文
ProsoCodec:用于语音转换的面向韵律的语音编解码器
ProsoCodec: Prosody-Oriented Speech Codec for Voice Conversion
摘要
神经语音编解码器可以有效地压缩语音,并已成为语音生成的基础,但它们通常作为将语言内容、说话者身份和韵律交织在一起的整体表示来学习。虽然这种设计对于零样本语音克隆很有效,但它阻碍了需要韵律保存或传输的下游任务,例如语音转换。为了解决这个问题,我们引入了 ProsoCodec,一种面向韵律的语音编解码器,它将韵律建模为条件残差而不是解缠结的流。具体来说,通过将文本和说话人嵌入作为前缀标记来调节编码器和解码器,鼓励离散瓶颈捕获内容和说话人无法解释的韵律变化。为了进一步保留韵律,我们使用低频梅尔带并在配对的同一说话人的话语上训练模型。语音转换实验表明韵律保存得到改善并减少了源音色泄漏。