论文

建筑环境视觉语言表示中效价和唤醒的组织:来自 EMOIS 数据集的见解

Organization of Valence and Arousal in Vision-Language Representations of Built Environments: Insights from the EMOIS Dataset

模型评测模型行为与机制分析

摘要

建筑环境的视觉感知有助于人们在日常生活中形成情感印象。然而,这些印象如何在视觉基础模型中表示仍然很大程度上未被探索。为了支持该主题的系统研究,我们引入了空间情感印象 (EMOIS) 数据集,其中包含 1,544 个真实世界的建筑环境图像。每张图像都注释有图像诱发效价和唤醒评级,这些评级是通过进行大规模网络调查从日本成年人那里收集的,每张图像大约有 120 个评级。使用对比语言-图像 预训练 (CLIP) 表示,我们进行预测和几何分析,以系统地研究效价和唤醒如何在表示空间内编码和组织。这些分析表明,效价表现出比唤醒更强大、更连贯的组织。使用开放情感标准化图像集(OASIS)(一般情感照片的基准数据集)进行的跨数据集分析揭示了两个数据集之间情感组织的差异。回归分析表明 EMOIS 对效价和唤醒具有较高的预测性能,在重复的内部保留评估中,平均确定系数分别为 0.865 和 0.807。最后,我们提出了一个基于示例的界面,说明学习的表示如何支持预测情感值的定性解释。这些发现可以帮助阐明建筑环境的情感表征,并将 EMOIS 建立为该领域未来情感计算研究的密集注释资源。