论文
AffectSpeech:具有细粒度文本描述的大规模情感语音数据集,用于语音情感描述和合成
AffectSpeech: A Large-Scale Emotional Speech Dataset with Fine-Grained Textual Descriptions for Speech Emotion Captioning and Synthesis
摘要
情感在口语交流中至关重要,但大多数现有的语音情感建模框架依赖于预定义的类别或低维连续属性,其表达能力有限。语音情感描述和合成的最新进展表明,文本描述为表示语音中的情感特征提供了更灵活和可解释的替代方案。然而,由于缺乏与可靠且细粒度的自然语言注释相一致的情感语音数据集,这一方向的进展受到阻碍。为了解决这个问题,我们引入了 AffectSpeech,这是一个大规模的人类录制语音语料库,其中包含用于细粒度情感分析和生成的结构化描述。每个话语都具有六个互补维度的特征,包括情感极性、开放词汇情感描述、强度水平、韵律属性、突出片段和语义内容,从而实现声音表达的多粒度建模。为了平衡注释质量和可扩展性,我们采用了人类 LLM 协作注释管道,该管道集成了算法预标记、多 LLM 描述生成和人类在环验证。此外,这些注释被重新表述为不同的描述风格,以增强语言多样性并减少下游建模中的风格偏差。语音情感描述和合成的实验结果表明,在 AffectSpeech 上训练的模型在多个评估设置中始终取得优异的性能。