论文

ParaSpeechCLAP:以双编码器对齐语音与丰富风格描述

ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining

模型训练预训练

摘要

我们引入了 ParaSpeechCLAP,这是一系列双编码器模型,可将语音和文本风格描述映射到共享嵌入空间,支持丰富的内在(说话者级)和情境(话语级)描述符,例如音调、音色质感和情感,超出了现有模型处理的狭窄集合。我们训练单独的内在模型和情境模型以及统一的组合模型,发现专用模型在个体风格维度上更强,而统一模型在组合风格评估方面表现出色。我们进一步表明 ParaSpeechCLAP-Intrinsic 受益于额外的分类损失和类平衡训练。我们展示了风格描述检索、语音属性分类的性能,以及作为风格提示 TTS 的推理时间奖励模型的可用性。 ParaSpeechCLAP 模型在所有三个应用程序的大多数指标上都优于基线。我们的模型和代码发布在 https://github.com/ajd12342/paraspeechclap 。