论文
编辑说话者,控制他们说话的方式:TTS 的全局音色编辑和本地指令控制
Edit Who Speaks, Control How They Speak: Global Timbre Editing and Local Instruction Control for TTS
摘要
基于指令的文本转语音 (TTS) 通过语音克隆和基于文本的语音设计等界面提供对语音特征和语音表达的控制。语音克隆再现参考语音,而基于文本的语音设计则根据自然语言描述创建语音。然而,这两个界面都没有直接允许用户修改给定参考的音色并用修改后的声音合成语音。同时,话语级表达指令未指定各个文本段之间的变化。我们引入了 \textbf{EDICT},这是一个框架,通过使用经过编辑的声学参考来锚定跨片段的语音身份,统一全局音色编辑和局部表达控制。为了实现指令编辑语音的合成,EDICT 将参考音频与结构化音色编辑相结合,以在编解码器token空间中生成编辑后的参考。这种表示形式充当冻结 TTS 骨干的共享语音锚点,允许特定于片段的自然语言指令来指导表达。为了适应指令的变化 在支持声学连续性的同时,EDICT 在每个段边界重建 KV 缓存,刷新指令条件,同时保留先前生成的语音的有界声学上下文。对我们提出的 TimbreEdit-Bench 和 IntraTTS-Bench 的评估表明,音色编辑得到了改进,并且在局部指令遵循性、说话者一致性和过渡质量之间取得了良好的平衡。提供音频演示。