论文

诊断,然后优化:具有 AudioLLM 引导校正的闭环 TTS 系统

Diagnose, Then Refine: A Closed-Loop TTS System with AudioLLM-Guided Correction

模型推理推理验证与自校正

摘要

当前的 TTS 系统通常依赖于开环、单遍生成,并且可能会产生零星的局部韵律缺陷,例如重音错位、不自然的停顿或语调扁平,而话语级指标通常无法揭示这些缺陷。我们提出了 LoopTTS,这是一个判断引导的 Filter-Judge-Refiner 框架,用于恢复由 AudioLLM 诊断的低质量 TTS 输出。给定基本 TTS 模型的初始话语,AudioLLM Judge 会识别突出的韵律问题并生成结构化的细化指令; Refiner 是我们的细粒度指令跟踪 TTS 模型,然后根据初始话语、目标文本和指令执行引导式表达重新合成。为了训练 Refiner,我们构建了 Refiner-DB,这是一个带有 42K 示例的 AudioLLM 注释数据集,具有单词级韵律弱监督。对诊断出的低质量话语的人工评估表明,LoopTTS 可以检测感知上的显着错误,并使用 Refiner 进行纠正,在恢复质量方面优于原始生成的音频和实际的开环再生基线。 Refiner 还表现出更强的指令跟踪能力,可以在有针对性的韵律修改中实现重音和停顿控制。