论文
ProFocus:通过渐进式视觉聚焦诠释艺术图像中的情感体验
ProFocus: Interpreting Affective Experience in Artistic Images with Progressive Visual Focusing
摘要
解释图像引发的情绪反应是实现情商的核心。与自然图像相比,视觉艺术是有意创造的,通过抽象概念和视觉隐喻来引发观众的情感反应,这使得情感解读尤其具有挑战性。然而,大多数现有方法依赖于通用视觉嵌入(例如 CLIP),无法捕捉艺术情感背后的微妙线索。为了解决这一差距,我们提出了 \textbf{ProFocus},这是一种新颖的框架,通过渐进式视觉聚焦来模拟艺术图像中的情感体验。关键思想是受人类审美欣赏的分层认知理论的启发,对视觉表征学习进行建模。从技术上讲,ProFocus 包含两个核心组件:分层艺术评论 (HAC) 和渐进提示融合 (PHF) 模块。 HAC 利用多模态 大语言模型 在三个认知层面(氛围风格、叙事主题和具体细节)生成结构化语言先验,从而将艺术感知转化为连贯的语义指导。基于这些先验,PHF 不同于传统的跨模态融合,它将分层提示依次注入视觉特征中,从而实现反映人类感知的渐进聚焦过程。这种设计使模型能够捕捉微妙的情感线索并产生更忠实的解释。对 ArtEmis v1.0 和 v2.0 数据集的大量实验表明,ProFocus 在情感识别和情感解释方面始终优于最先进的方法。项目页面:https://github.com/Zhang-Zhiyan/ProFocus。