论文

MultiEmo-Bench:多模态的多标签视觉情感分析 大语言模型

MultiEmo-Bench: Multi-label Visual Emotion Analysis for Multi-modal Large Language Models

模型评测基准与评测资源

摘要

本文介绍了一个多标签视觉情感分析基准数据集,用于综合评估多模态 大语言模型(MLLM)预测图像引发的情感的能力。最近的用户研究报告了一个不直观的发现:与现有数据集中的标签相比,人类可能更喜欢 MLLM 的预测。我们认为这种现象源于现有数据集中使用的次优注释方案,其中每个注释器都向每个图像显示单个候选情绪,并判断它是否被唤起。这种方法显然有局限性,因为单个图像可以唤起不同强度的多种情绪。因此,基于这些数据集的评估可能会低估 MLLM 的能力,但仍然缺乏评估此类模型的适当基准。为了解决这个问题,我们引入了一个新的多标签基准数据集,用于针对 MLLM 评估进行视觉情感分析。我们为每张图像聘请 20 美元的注释员,并要求他们选择他们从图像中感受到的所有情感。然后,我们汇总所有注释者的投票,提供一个更可靠、更具代表性的数据集,并标记了情绪分布。生成的数据集包含 10,344 美元的图像,其中八种情绪的有效投票为 236,998 美元。基于这个基准数据集,我们评估了几个最新的模型,包括 Qwen3-VL、OpenAI 的 GPT、Gemini 和 Claude。我们评估模型在主导情绪预测和情绪分布预测方面的性能。我们的结果证明了最近 MLLM 取得的进展,同时也表明仍然存在很大的改进空间。此外,我们以 LLM 作为评判者的实验表明,该方法并不能持续提高 MLLM 的性能,表明其对于视觉情感分析的主观任务的局限性。