论文

SpeechEQ:社交意识语音对话模型中情商的基准测试

SpeechEQ: Benchmarking Emotional Intelligence Quotient in Socially Aware Voice Conversational Models

模型评测基准与评测资源

摘要

随着多模态对话系统越来越多地参与口头交互,它们导航副语言社交线索的能力已成为自然人类与人工智能交流的关键瓶颈。然而,现有的机器情绪智力评估仅通过孤立的文本或被动的声感知来评估推理,忽略了主动、多轮对话所需的复杂的跨模态推理。我们引入 \textsc{SpeechEQ},一个旨在评估语音语言模型(SLM)的社会语言推理的综合框架。该框架包括基于 EQ-i 2.0 理论的跨 15 个情商 (EQ) 子量表的 2,265 个对话的经过验证的数据集,以及受人类情商评估启发的我们提出的口语 EQ (SEQ) 分数测量的多轮评估协议。实验表明,现有的语音情感识别和端到端语音语言模型在通过语音理解和应用副语言线索方面存在局限性。虽然端到端架构的性能优于级联系统,但 \textsc{SpeechEQ} 揭示了当前的多模态模型仍然受到文本依赖的“模态捷径”、对齐引起的“安全陷阱”和“上下文失忆症”的瓶颈,凸显了真正具有情感意识的人工智能的障碍。我们的基准测试可以通过 https://huggingface.co/datasets/SpeechEQ/SpeechEQ 访问,演示页面可以通过 https://binomial14.github.io/speecheq-demo/ 访问