论文

面向老年人的语音合成的模仿学习

Imitation Learning for Elder-Facing Speech Synthesis

模型训练偏好优化

摘要

文本转语音 (TTS) 合成的最新进展已经实现了高度自然且富有表现力的语音生成。然而,这些系统是为普通成年人设计的,忽视了老年人由于与年龄相关的感觉和认知衰退而导致的言语理解需求。之前的工作涉及老年人,通过收集偏好反馈来调整模型参数。然而,获得足够的偏好数据成本高昂且困难,因为老年人在收集过程中很快就会感到疲劳。在本文中,我们提出了一种新颖的模仿学习(IL)框架,用于从专家演示中学习 TTS 模型。我们通过两阶段 同策略 奖励学习(OPRL)进一步改进组相对策略优化(GRPO),以在专家演示的有限监督下减轻 奖励作弊 的影响。实验结果表明,GRPO w/ OPRL 在客观和主观指标方面优于 GRPO 和监督基线。音频样本可在 https://dongru1.github.io/demo/im-efss 获取