论文

SCIC:适用于说话人自适应表达 TTS 的范围和码本感知指令调节

SCIC: Scope- and Codebook-Aware Instruction Conditioning for Speaker-Adapted Expressive TTS

模型训练监督微调与指令调优

摘要

长篇直播 TTS 需要上下文相关的韵律和段落级别的连贯性。然而,许多现有的基于指令的 TTS 系统使用全局或统一条件,对子句级相对韵律变化提供有限的显式控制。我们引入了与说话者相关的内联韵律控制,其中每个音高、能量或速度指令都针对与来自同一说话者的前一个子句相关的子句,而暂停则使用绝对持续时间间隔。在基于编解码器的 TTS 中,速度和暂停会影响序列长度,而音调和能量则依赖于剩余码本。通过分析 Qwen3-TTS RVQ 码本,我们发现 Energy 集中在早期剩余码本中,而 Pitch 则在更深的前缀中累积。因此,我们提出了范围和码本感知指令调节(SCIC),将用于帧级标签激活的临时指令路由器与剩余码本上的标签特定码本加权相结合。 SCIC 使用文本标记标签改进了对标准指令微调的与说话者相关的音调和能量控制。我们进一步应用多奖励 GDPO 后训练来联合优化控制和质量,提高控制精度,同时保持 CER 和说话者相似性。在长格式合成中,SCIC 比没有指令的针对说话人的 SFT 产生更独特的段落级表达层次结构。音频演示位于:https://taoliveaigc.github.io/SCIC/