论文

EmoS:用于评估和调整口语模型中的情绪智力的基于理论的框架

EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models

模型评测评测方法与指标

摘要

尽管在指令遵循和听觉理解方面取得了重大进展,但口语模型(SLM)中情商(EI)的评估仍然局限于基本的副语言感知,缺乏系统的、理论驱动的认知框架。我们推出了 EmoSBench,这是第一个基于四分支理论模型构建的 SLM 综合 EI 评估基准,涵盖十个子任务的感知、理解、使用和管理情绪。 EmoSBench 的初步评估揭示了巨大的差距:即使是 GPT-4o-Audio 等领先的专有模型也只能达到 52.6%,明显落后于人类基线。为了弥补这一差距,我们开发了 EmoS,这是一种通过监督 微调 (SFT) 和组相对策略优化 (GRPO) 进行优化的专门评估器模型。为了促进其有效训练,我们策划了 EmoDialogue,这是一个双语数据集,通过具有严格定义的 EI 等级的响应对提供必要的细粒度监督。同时,我们引入了一种集成陡峭指数准确性奖励(SEAR)和基本原理忠诚奖励(RFR)的奖励机制,以强制执行精确的序数评分和有效推理。实验表明,EmoS 的准确率达到 83.8%,接近人类水平。此外,对真实、不受约束的口头交互的评估验证了其强大的现实世界泛化能力,为推进情感智能对话系统建立了基础框架。