论文
CAREBench:通过认知评价推理评估LLM的情绪理解能力
CAREBench: Evaluating LLMs' Emotion Understanding by Assessing Cognitive Appraisal Reasoning
摘要
情绪理解是LLM与人类有效互动的核心能力,但现有评估范式依赖离散情绪标签预测,无法捕捉情绪生成背后的认知过程。基于评价理论,我们提出CAREBench,这是首个在真实世界叙事上提供第一人称与第三人称双视角完整推理链标注的基准,涵盖评价推理、评价评分与多标签情绪标注。我们提出过程级评估框架,并围绕四个研究问题对六个LLM开展系统实验。我们发现,更强的模型在某些任务上可与人类观察者持平或超越,但在评价推理和积极情绪识别上存在不足;各链路步骤上的表现以及对评价干预的敏感性在不同模型间呈现分离;当前模型尚未内化捕捉人类主观异质性所需的机制。这些发现表明,下游情绪预测指标可能高估了LLM真正的情绪理解能力,而CAREBench为对LLM情感认知能力进行更具诊断价值的评估提供了基础。
