论文

AICA-Bench:全面检验 VLM 在情感图像内容分析中的能力

AICA-Bench: Holistically Examining the Capabilities of VLMs in Affective Image Content Analysis

模型评测基准与评测资源

摘要

视觉语言模型(VLM)在感知方面表现出了强大的能力,但将感知、推理和生成集成到统一框架中的整体情感图像内容分析(AICA)仍处于探索之中。为了解决这一差距,我们推出了 AICA-Bench,这是一个包含三个核心任务的综合基准测试:情绪理解 (EU)、情绪推理 (ER) 和情绪引导内容生成 (EGCG)。我们评估了 23 个 VLM 并确定了两个主要限制:弱强度校准和浅层开放式描述。为了解决这些问题,我们提出了扎根情感树(GAT)提示,这是一个将视觉脚手架与分层推理相结合的 无需训练 框架。实验表明,GAT 减少了强度错误并提高了描述深度,为未来情感多模态理解和生成的研究提供了强有力的基线。