论文
HPRO:通过偏好提取进行情感文本转语音的分层渐进奖励优化
HPRO: Hierarchical Progressive Reward Optimization via Preference Extraction for Emotional Text-to-Speech
摘要
最近,基于 大语言模型 (LLM) 的文本转语音 (TTS) 模型取得了显着的自然度。然而,标准的监督 微调 范式通常会收敛于统计平均韵律,从而限制了情感表达。虽然偏好驱动的优化提供了一种有希望的替代方案,但现有的方法存在两种结构性不匹配的问题:信息冲突,共享潜在空间中的内容和情感产生冲突的梯度,导致 奖励作弊 和语义退化;和规模差距,稀疏的句子级奖励难以指导密集的帧级生成。为了克服这些挑战,我们提出了 HPRO,一种分层渐进式奖励优化框架。在 HPRO 中,我们引入 HD-Emo 编解码器作为一种新颖的可微奖励模型来减轻信息冲突。它将语音提取为不同的内容和风格偏好标记,从结构上将情感优化与语义内容隔离开来。在此结构化偏好空间的基础上,HPRO 通过逐步调整框架、单词和句子级别的目标来弥补规模差距。实验表明,HPRO 显着增强了情感表达能力,同时有效地保持了语言的可理解性。代码和音频示例可在 https://xxh333.github.io/hpro-demo/ 上公开获取。