论文
对话式语音美学模型与人类听众的强化学习
Conversational Voice Aesthetic Model with Reinforcement Learning from Human Listeners
摘要
我们引入了会话语音美学模型,这是一种语音大语言模型,用于描述自然会话上下文中真实或合成语音响应的语音美学。给定上下文和响应语音,CVAM 描述了表征语音的显着时刻,并预测了涵盖性别、音调、节奏、情感和表达方式的九个类别属性。关键的挑战在于情感和表达等感知领域,这些领域本质上是主观的,缺乏明确的事实依据。因此,我们为来自 CANDOR 语料库的 3k 个真实和合成响应中的每一个收集了约 10 个人类注释。 CVAM 在合成的美学描述和标签上进行监督微调,然后根据人类判断通过组相对策略优化进行优化。实验表明,与 Gemini 3.1 Pro 和开源语音LLM相比,CVAM 与人类听众的一致性更好,并且优于单人与其他人的一致性。我们共同证明了将声音美学植根于人类感知的重要性,并提出了人类声音美学的原则框架。 结盟。