论文

MVEI & EmObserver:通过情绪陈述判断赋能面向 MLLM 的视觉情绪智能

MVEI & EmObserver: Empowering MLLM-Oriented Visual Emotional Intelligence via Emotion Statement Judgement

模型评测基准与评测资源

摘要

情感图像内容分析(AICA)旨在识别和理解视觉内容引发的情感,是迈向通用人工智能(AGI)不可或缺的一步。然而,尽管多模态 大语言模型 (MLLM) 取得了快速进展,但最近发布的模型仍然基本上缺乏对其视觉情绪智力的系统评估。我们将这种差距归因于传统 AICA 范式与 MLLM 的开放式、指令驱动性质之间的结构性不匹配,进一步分析揭示了四个主要局限性:省略合理的反应、有限的情感分类、忽视情境因素和劳动密集型注释。为了克服这些障碍,我们引入了情感陈述判断(ESJ),这是一种陈述验证公式,可以保留输入空间的表达性,同时将输出限制为歧视性判断。我们进一步开发 INSETS,这是一个劳动效率高的管道,通过构建 INSETS-462k 并支持 MVEI(一个涵盖情感极性、情感解释、场景上下文和感知主观性的严格完善的基准)来大规模实例化 ESJ。除了评估之外,我们还构建了 EmObserver,这是一个通过精心设计的多阶段配方在 ESJ 上优化的面向情感的 MLLM。对 MVEI 上的广谱 MLLM 进行的广泛评估揭示了对当前人工视觉情感智能的细粒度洞察,而在多个 AICA 基准上的实验则证明了 EmObserver 的准确性、泛化性和推理能力 忠实性。总的来说,这些结果将 ESJ 确立为实用的表述,将 MVEI 确立为综合基准,将 EmObserver 确立为推进面向 MLLM 的视觉情绪智力的高级基线。代码将发布在:https://github.com/wdqqdw/EmObserver。