论文
InsightVQA:高维情感认知视觉问答基准
InsightVQA: High-Dimensional Emotion-Cognitive Visual Question Answering Benchmark
摘要
视觉情感理解不仅需要模型来识别情绪状态,还需要识别它们为何出现并执行更高层次的认知推理。然而,现有的基准主要关注情感识别,对基础理解和面向响应的分析提供有限的支持。为了解决这一差距,我们引入了 \textbf{InsightVQA},这是一个用于情感理解和认知推理的分层视觉问答的大型数据集。基于从六个公共来源收集的 351K 图像,我们应用严格的多级过滤管道来管理 138K 高可信度图像。每张图像都在三个层次上进行注释:用于情感和效价识别的感知 QA、通过约束引导生成从视觉触发提取构建的基础理解 QA,以及以响应意图预测和顺序洞察推理为中心的认知 QA。 InsightVQA 总共包含 725K QA 对。我们进一步提出了 \textbf{InsightVQA-Bench},这是一个高质量的评估基准,包含 30K 个样本,用于细粒度评估。为了支持评估,我们引入了 \textbf{InsightNet},这是 MLLM 的情感调整基线。结果表明,InsightVQA 对基础情感理解和推理提出了重大挑战。