论文

ArtECulture:多模式中文化条件视觉情感理解的基准测试 大语言模型

ArtECulture: Benchmarking Culture-Conditioned Visual Emotion Understanding in Multimodal Large Language Models

模型评测基准与评测资源

摘要

现有的视觉情感理解方法通常忽略情感感知的文化差异。我们引入了文化条件下的视觉情感理解,这是一项预测给定图像的特定文化情感感知并解释其基本原理的任务。尽管存在相关基准,但它们受到不一致的个体注释的限制,这阻碍了大多数人支持的文化层面情感标签的推导,以及文化覆盖范围的不平衡。因此,我们提出了 ArtECulture,一个包含 6,792 件艺术品的基准,这些艺术品具有跨英语、中国和阿拉伯文化的特定文化情感标签和解释,并且具有平衡的西方和非西方内容。在零样本设置下对 16 个开源和闭源多模态 大语言模型 (MLLM) 的评估表明,该任务仍然具有挑战性,最佳模型的准确率低于 50%。为了解决这一局限性,我们引入了一种检索增强的文化条件情感理解框架,该框架利用基于概念的文化情感知识库将明确的文化知识注入 MLLM 中,而无需额外的训练。该框架改进了文化上一致的情绪预测和扎根的解释生成。我们的基准和代码将公开发布。