论文

量化情感差距:LLM 在细粒度情感分类上的零样本评估

Quantifying the Affective Gap: A Zero-Shot Evaluation of LLMs on Fine-Grained Emotion Taxonomies

模型评测模型能力评测

摘要

自然语言中的情感识别是情感计算的一个基本挑战,对人机交互、心理健康支持和对话人工智能具有重要影响。本文对三个领先的商业 大语言模型 进行了严格、统一的零样本评估:Claude (claude-sonnet-4-6)、ChatGPT (GPT-5.4) 和 Gemini (gemini-2.5-flash)。截至 2026 年 4 月,这些模型通过各自的生产 API 针对细粒度的 13 类情感分类任务进行了查询。使用来自 Boltuix/emotions 数据集(包含 13 个类别的 131,306 个句子)的分层 1,000 个句子样本,在所有模型中以相同的方式应用没有范例的单一统一提示。 Gemini 实现了最高的准确率(39.9%)和 Macro-F1 得分(0.363),其次是 GPT-5.4(38.8%,macro-F1 = 0.291)和 Claude(38.0%,macro-F1 = 0.159)。所有模型都擅长讽刺和欲望,但在爱、困惑和羞耻方面始终失败。 McNemar 检验显示没有统计学上显着的成对差异 (p > 0.10),表明在共享的零样本上限处收敛。 Claude 的宏观 F1 分数明显较低,暴露了类别不平衡的预测偏差。这些发现凸显了前沿人工智能系统当前在零样本细粒度情感分类方面的局限性。