论文

顺序轨迹和同时混合:用于指令跟踪 TTS 的多情感建模

Sequential Trajectories and Simultaneous Blending: Multi-Emotion Modeling for Instruction-Following TTS

模型训练强化学习

摘要

自然语言指令可以灵活控制合成语音,但情感 TTS 系统主要模拟单一话语级情感,而多情感控制尚未得到充分探索。我们研究了两个互补的多情感 TTS 任务:情感轨迹(跨越几个有序的情感阶段)和情感混合(其中多种情感在整个话语中共存)。这些任务暴露了监督不匹配:监督 微调 (SFT) 没有明确评估情感特征,而单一情感奖励既不提供用于轨迹完成的结构感知反馈,也不提供用于混合的配对感知反馈。我们引入了 HybridEmo,这是一个 后训练 框架,它使用 SFT 初始化这两个任务,然后使用样本感知混合奖励通过组相对策略优化来调整语音词元策略。对于轨迹样本,分段对齐一致性结合了平均和最弱阶段证据,以保持规定阶段的正确性和完整性。对于混合样本,基于 GMM 的奖励将离线情感空间中目标情感锚联合的帧级支持与话语级较弱目标边缘相结合。两个分支共享 ASR 奖励,并在统一的策略内进行路由。在 MultiEmo-Test 上,HybridEmo 显着提高了轨迹正确性和混合强度,而说话者相似度没有明显下降。与 CosyVoice 3 和 EmoVoice-0.5B 相比,人类评估更喜欢 HybridEmo,与 Qwen3-TTS 的偏好几乎平衡。