论文
基于属性的多模态选择性推理艺术品情感理解 大语言模型
Attribute-Grounded Selective Reasoning for Artwork Emotion Understanding with Multimodal Large Language Models
摘要
多模态 大语言模型 (MLLM) 可以产生流畅的艺术品情感解释,但它们经常遭受属性泛滥的困扰:它们列举了许多可见的形式属性,但没有确定哪些线索实际上支持情感判断。因此,我们将艺术品情感理解制定为基于属性的选择性推理(AGSR),其中预定义的形式属性作为证据单元,只有情感操作属性才应进入最终解释。为了使这个问题可衡量,我们扩展了 EmoArt(最初在 ACM MM 2025 上作为包含内容、形式属性、效价唤醒和情感注释的 132,664 件艺术品资源引入),添加了由 15 名受过艺术训练的注释者注释的 1,400 件艺术品人类显着性扩展。此扩展提供实例级监督,用于区分仅存在的属性和情感上突出的属性。我们进一步提出 FAB-G(形式属性瓶颈引导推理),这是一种有监督的多智能体框架,它首先预测属性级别的显着性,然后将下游情感分析限制在保留的线索上。实验表明,FAB-G 在情绪、唤醒和效价预测方面产生了一致的收益,在 Dice 和 Tversky 指标下与人类标记的显着属性达到了更强的一致性,并产生了比基于提示的基线更紧凑的最终解释。跨数据集评估进一步表明,基于属性的显着性选择超出了 EmoArt 的源分布,同时还揭示了特定于属性的边界情况。数据集和项目页面可在 https://zhiliangzhang.github.io/EmoArt-130k/ 获取