论文
直播语音合成的多维韵律判断
Multi-Dimensional Prosody Judgment For Live Streaming Speech Synthesis
摘要
评估实时流语音合成 (TTS) 需要评估传统 MOS 预测器无法捕获的细粒度、高度表现力的韵律,例如情感、语调和能量。虽然像 Gemini 这样的专有大型语言模型 (LLM) 可以评估这些方面,但对于大规模推理和强化学习反馈来说,它们的成本太高。为了解决这个问题,我们首先引入 Live-ProsodyJudge (LPJ),这是一种从 Gemini 提炼到 Qwen3-Omni 中的经济高效的成对评估器。然而,我们发现标准多维评估中的一个关键缺陷:判决耦合。法官倾向于懒惰地将所有个人维度得分与其总体偏好对齐,将丰富的多维度评分细则分解为单个偏好位。为了解决这个问题,我们进一步提出了 De Coupled-Live-ProsodyJudge (D-LPJ)。 D-LPJ消除了总体判定目标以防止盲目跟随,在监督微调(SFT)期间掩盖了不确定的对维度,并引入了一种新颖的跨度局部GRPO策略,该策略将归一化优势严格应用于其相应的基本原理跨度。在精心策划的人工注释测试集上进行评估,10 个样本平衡阶 LPJ 比单个 Gemini 调用实现了更高的点精度,而 D-LPJ 成功地产生了独立、解耦的维度判断。此外,在 Best-of-8 TTS 候选选择锦标赛中,LPJ 选择的话语在 85.29% 的高置信度案例中属于人类前三名,这证明了其对细粒度 TTS 偏好优化的有效性。