论文
VoiceWeaver:用于表达语音和声音事件生成的结构化控件的分阶段学习
VoiceWeaver: Staged Learning of Structured Controls for Expressive Speech and Sound-Event Generation
摘要
向语音生成器添加表达和环境控制需要学习异构属性而不丢失早期功能。 VoiceWeaver 通过结构化标签前缀和共享文本音频模型中的分阶段情感音调事件训练解决了这个问题。基于重播的蒸馏保留了早期的预测,同时嵌入去相关和属性丢失对条件进行正则化。评估分为单属性正确性、联合情感事件生成和三属性正确性。四舍五入到整数百分点后,中文的情感准确度为 86%,英语的情感准确度为 83%。中国人的情绪-事件联合准确率约为 70%,而混合任务训练为 56%,Ming-omni-tts 为 48%;英语联合准确率为66%。在各 500 个样本中,中文的三属性准确率为 59%,英文的三属性准确率为 55%(合计 57%)。文本错误率超过外部 TTS 基线。音频样本可在 https://anonymous.4open.science/api/repo/VoiceWeaver1-4D88/file/index.html. 获取
