论文
情感明暗对比:基于评价理论的对比情感基准
Chiaroscuro for Emotions: A Contrastive Emotion Benchmark Grounded in Appraisal Theory
摘要
情绪识别基准通常会预测每个文本的一种情绪,而忽略了许多现实世界的场景,即两个人从单个共享事件中得出相反的情绪。例如,一个孩子兴奋地踢前面的座位,而前面的乘客则生气了。我们介绍了 CHIARO,这是一个基于评估理论的对比情感推理的 1,000 个人工注释句子基准。每个场景都描述了一种因果触发因素,该触发因素会在一个人身上引发积极情绪,而在另一个人身上引发消极情绪,这些触发因素来自十级分类法。我们对七个前沿 LLM 和四个现成的情感分类器进行了基准测试。最强的 LLM 达到 67.3 宏观 F1,远低于人类的一致性,而现有的情绪分类器得分接近机会。除了评估之外,CHIARO 还可以作为训练信号。当与现有的情感语料库相结合时,生成的下游分类器对 CHIARO 本身以及十个外部情感基准中的六个进行了改进,这将我们的数据集定位为情感识别的补充信号。