论文

大语言模型的情绪智能在感知、认知与交互上呈现碎片化

Emotional intelligence in large language models is fragmented across perception, cognition, and interaction

模型评测基准与评测资源

摘要

随着大语言模型(LLM)日益被整合进情绪敏感领域,其情绪智能(EI)的结构完整性成为安全与对齐的关键前沿。现有基准常常将表面礼貌与深层情感推理混为一谈,未能区分感知准确性与交互有效性。本文提出FACET(Functional Affective Competence and Empathy Test),一个以心理测量学为基础、包含480道专家编制题目的框架。与以往指标不同,FACET在理论上锚定于Mayer-Salovey-Caruso四分支能力模型,通过情绪感知、促进、理解与管理来操作化情绪智能。通过对九个前沿模型(包括GPT-5、Claude-Sonnet-4)的评估,我们证明情绪智能并非单一整体能力,而是在认知与交互维度上碎片化。尽管前沿模型在客观情绪识别与社会推理上表现出稳健的能力,但这并不总能转化为交互上的成功。我们将这些差异归为三种不同的表现画像:认知主导、交互主导与情境依赖。这些类型学表明,情绪技能并不随通用智能或模型规模均匀扩展,而是由特定的对齐范式塑造。值得注意的是,我们发现隐藏情绪识别是跨所有架构的普遍性能瓶颈。我们的结果表明,当前RLHF过程可能优化的是“随机共情”——对情绪句法的统计性模仿——而牺牲了整合性情感推理。这些发现挑战了情绪能力线性扩展的假设,并为开发具备真正临床共鸣能力的社会感知智能体提供了严谨路线图。

大语言模型的情绪智能在感知、认知与交互上呈现碎片化:论文配图
图 1:FACET 评估框架概述。该基准从三个主要维度系统地评估人工智能 FACET。感知评估识别情绪状态的能力,包括明显情绪识别和隐藏情绪识别。认知评估情绪的逻辑和社会处理,包括情绪预测、社交充分性和危机识别。交互衡量移情对话的动态生成,包括情感深化、情感匹配、移情理解、表达自然度和情绪调节。