论文

在基于提示的文本转语音模型中解锁细粒度和话语内的说话风格控制

Unlocking Fine-Grained and Within-Utterance Speaking Style Control in Prompt-Based Text-to-Speech Models

应用与实践内容创作

摘要

虽然基于提示的文本转语音 (TTS) 模型可以实现自然语言驱动的说话风格控制,但它们通常提供有限的细粒度控制,并在整个话语中应用单一的全局风格。这限制了需要跨话语连续样式属性插值和单个话语内随时间变化的样式转换的实际用例。在本文中,我们提出了在现有基于提示的 TTS 模型中实现这两种功能的新技术。对于话语间风格插值,我们计算嵌入空间中对比风格提示之间的方向向量并执行简单插值,从而实现风格特征之间的平滑过渡。对于话语内风格转换,我们首先识别出对自回归 TTS 解码器中早期标记的强烈关注偏差,导致初始音频实现主导后续生成。为了减轻这种影响,我们引入了 KV 缓存交换和滑动窗口注意屏蔽。实验表明,我们提出的话语间插值在性别转换方面实现了 99-100% 的成功率,高达 36 Hz 的音调变化以及高达每秒 1.6 个音节的速度变化。我们的话语内转换保持了 0.81-0.91 的说话者相似度,并实现了 3.48-4.48 的感知平滑度分数。