论文

LLM 捕获情绪标签,而不是情绪不确定性:人类 LLM 判断差距的分布分析和校准

LLMs Capture Emotion Labels, Not Emotion Uncertainty: Distributional Analysis and Calibration of Human-LLM Judgment Gaps

模型评测模型能力评测

摘要

人类注释者经常在情感标签上存在分歧,但对 大语言模型 (LLM) 情感注释的大多数评估都将这些判断折叠成单一的黄金标准,丢弃了分歧编码的分布信息。我们通过比较人类注释者和四个零样本 LLM 之间的情绪判断分布以及微调的 RoBERTa 基线,跨两个互补基准:GoEmotions 和 EmoBank,总共 640,000 个 LLM 响应,询问 LLM 是否捕获了这种分歧的结构,而不仅仅是大多数标签。零样本模型与人类分布存在很大差异,需要域内 微调(而不是模型规模)来缩小差距。我们通过定量透明度分数来形式化词汇基础梯度,该分数预测每个类别的人类-LLM协议:LLM能够可靠地捕捉具有明确词汇标记的情绪,但在需要上下文推理的实用复杂情绪上系统性地失败,这种模式可以在分类和连续情绪框架中复制。我们进一步提出了三种轻量级事后校准方法,可将分布差距减少高达 14%,并为 LLM 情感注释何时可以或不能替代人类标签提供可操作的指南。