论文
AttuneBench:基于对话的 LLM 情商基准
AttuneBench: A Conversation-Based Benchmark for LLM Emotional Intelligence
摘要
情商(EI)即感知、理解并恰当回应他人情绪状态的能力,是人类沟通的核心,随着 LLM 在日常生活中承担对话角色,对其评估也日益重要。现有 EI 基准依赖合成提示、单轮案例或第三方标注。这些方法无法直接衡量模型在真实对话过程中如何推断并回应参与者的情绪状态。我们提出 AttuneBench,一个基于 200 段真实多轮人机对话的基准,参与者与匿名化 LLM 对话,并逐轮标注自己的情绪状态、模型行为以及自己偏好的回应。在 11 个被评估模型上,我们发现各模型在情绪识别、行为分类、偏好预测与评判回应质量上的排名基本相互独立,表明高情商行为可分解为若干可分离的能力。偏好对齐与回应质量评判对模型的区分度显著高于情绪标签准确率。这些结果表明,高情商行为要求预测特定用户在情境中想要什么样的回应——这一区分会被汇总评分所掩盖,也是单轮或合成格式无法跨轮直接捕捉的。AttuneBench 为评估这些能力中的每一项、以及诊断各模型在情绪显著对话中的特有优势与失效模式提供了框架。
