论文
驯服长格式文本转语音
Taming Long-form Text-to-Speech
摘要
长格式文本转语音 (TTS) 可实现具有一致韵律的多轮对话,并可从较长的参考音频中克隆出更高质量的语音。最近的开放权重自回归 TTS 模型(例如 Qwen3-TTS 和 VoxCPM2)在短格式提示上实现了最先进的词错误率 (WER) 和说话者相似度 (SIM),但在与长格式提示一起使用时会显着恶化。我们提出了局部注意力约束推理 (LACI),这是一种仅推理方法,可以近乎实时地检测 TTS 错误、回滚到错误出现并使用临时护栏重新生成,从而增加的计算开销可以忽略不计。使用 LACI,我们将 Qwen3-TTS-0.6B 的 10 个 RNG 种子的最差 N WER 在超过 1500 个单词的提示上从 35.2% 提高到 3.4%,甚至超过了在少于 500 个单词的提示上的 5.4\% 的简短形式可靠性。为了证明 LACI 在语音克隆可靠性方面的功效,我们提出了 SIM 指标的滑动窗口版本,我们称之为 wSIM。 wSIM 暴露了 SIM 未捕获的几种新颖的故障模式。 LACI 将 120 秒参考音频的最差 N wSIM 从 0.01 提高到 0.47,同时将 WER 高于 30% 的灾难性生成率从 26% 降低到 1% 以下