论文

连接数据、推理和对齐:上下文感知指令跟随 TTS 的统一框架

Bridging Data, Reasoning, and Alignment: A Unified Framework for Context-Aware Instruction-Following TTS

模型训练偏好优化

摘要

ISCSLP 2026 CoT-TTS 挑战赛要求 TTS 系统在合成适合上下文的语音之前,根据对话历史生成思维链 (CoT) 推理。虽然官方基线建立了统一的架构,但它仍然受到有限的上下文理解、较弱的指令保真度和次优音频质量的限制。我们提出了一个系统的优化管道来解决这些限制。首先,我们开发了一个数据处理框架,通过 FullSubNet 去噪、Qwen3-ASR 重转录和基于 Qwen3.5-35B-A3B 的历史 CoT 一致性分析来清理原始数据,同时在严格的质量过滤下使用 Qwen3-TTS 和 Seed-VC 提取 545K 高保真指令样本。其次,我们提出了上下文感知直接偏好优化(CA-DPO)方法。通过采用级联过滤策略、ASR 预筛选、LLM 锦标赛排名和说话者相似度验证,我们获得了高置信度偏好对,可显着增强 DPO 训练期间整体“Context$\rightarrow$CoT$\rightarrow$Speech”的一致性。第三,我们建立了一个具有500个样本测试集和LLM作为法官框架的评估方法,以独立评估推理和执行保真度。实验表明,我们的系统在所有客观和主观指标上都显着优于基线,验证了我们的数据治理和调整策略。