论文

EmoTrans:多模态中理解、推理和预测情绪转变的基准 LLM

EmoTrans: A Benchmark for Understanding, Reasoning, and Predicting Emotion Transitions in Multimodal LLMs

模型评测基准与评测资源

摘要

最近的多模态 大语言模型 (MLLM) 在感知、推理和生成方面表现出了强大的能力,并且越来越多地应用于社交机器人和人机交互等理解人类情感至关重要的应用中。然而,现有的基准主要将情感理解作为一个静态识别问题,这使得目前的 MLLM 是否能够将情感理解为一个动态过程,在不同的社会背景下演变、转换和展开,目前还不清楚。为了弥补这一差距,我们提出了 EmoTrans,这是一个评估多模态视频中情感动态理解的基准。 EmoTrans 包含 1,000 个精心收集和手动注释的视频剪辑,涵盖 12 个真实场景,并进一步提供 3,000 多个特定任务的问答 (QA) 对以进行细粒度评估。该基准引入了情绪变化检测(ECD)、情绪状态识别(ESI)、情绪转换推理(ETR)和下一步情绪预测(NEP)四个任务,形成了从粗粒度检测到更深层次推理和预测的渐进评估框架。我们对 EmoTrans 上的 18 个最先进的 MLLM 进行了全面评估,并获得了两个主要发现。首先,尽管当前的 MLLM 在粗粒度情感变化检测方面表现出相对较强的性能,但它们在细粒度情感动态建模方面仍然存在困难。其次,复杂的社交环境,尤其是多人场景,仍然具有很大的挑战性,而面向推理的变体并不能始终产生明显的改进。为了方便未来的研究,我们在 https://github.com/Emo-gml/EmoTrans 公开发布了基准、评估协议和代码。