论文

SpeechSense:用于细粒度语音情感分析的副语言数据集

SpeechSense: A Paralinguistic-Focused Dataset for Fine-Grained Speech Sentiment Analysis

模型评测基准与评测资源

摘要

人工智能的最新进展彻底改变了语音处理,但有效的语音理解不仅需要辨别所说的内容,还需要辨别所说的方式。语音情感分析在为招聘和客户服务等各种现实应用程序解码这些副语言线索方面发挥着关键作用。然而,现有的语音情感分析研究面临两个主要局限性。首先,主流方法依赖于以文本为中心的管道,将自动语音识别与文本分析级联。这个过程不可避免地丢弃了韵律和语气等基本的声学特征,无法捕捉声学上模棱两可的话语中的态度含义。其次,当前的基准存在标签粒度不匹配的问题,优先考虑基本情绪(例如快乐、悲伤),而不是社会敏感性所需的微妙的人际立场(例如自信、不耐烦)。为了解决这些限制,我们提出了一个新颖的数据集 SpeechSense,用于细粒度的语音情感分析。具体来说,我们定义了一种专门的人际立场 8 类分类法,主要通过词汇内容之外的韵律线索来检测。然后,我们根据该分类法构建一个精心策划的数据集,该数据集是通过高保真语音合成和严格的人工验证构建的。跨多模态 LLM、纯文本 LLM 和语音编码器的综合实验表明,具有声学访问功能的模型始终优于纯文本基线。这些结果从经验上验证了声学线索在检测微妙的说话者态度方面的首要地位,强调了 SpeechSense 的必要性。数据集和补充材料可在 https://github.com/Sher13cked/SpeechSense 获取。