论文

A-MAR:面向细粒度艺术品理解的智能体多模态艺术检索

A-MAR: Agent-based Multimodal Art Retrieval for Fine-Grained Artwork Understanding

上下文与知识检索增强

摘要

理解艺术品需要对视觉内容以及文化、历史和风格背景进行多步推理。尽管近期的多模态大语言模型在艺术品解说方面展现出潜力,但它们依赖隐式推理和内化知识,限制了可解释性和显式证据锚定。我们提出A-MAR,一个基于智能体的多模态艺术检索框架,它显式地以结构化推理计划为条件来约束检索。给定一件艺术品和用户查询,A-MAR首先将任务分解为结构化推理计划,明确每一步的目标和证据需求。随后检索以该计划为条件,实现有针对性的证据选择,支持逐步的、有据可依的解说。为评估艺术领域内基于智能体的多模态推理,我们引入ArtCoT-QA。这一诊断性基准为多样化的艺术相关查询提供多步推理链,支持超越简单最终答案准确率的细粒度分析。在SemArt和Artpedia上的实验表明,A-MAR在最终解说质量上持续优于静态的、无计划的检索以及强大的MLLM基线;在ArtCoT-QA上的评估进一步展示了它在证据锚定和多步推理能力上的优势。这些结果凸显了以推理为条件的检索对知识密集型多模态理解的重要性,并将A-MAR定位为迈向可解释、目标驱动AI系统的一步,对文化产业尤具相关性。代码和数据可在 https://github.com/ShuaiWang97/A-MAR 获取。

A-MAR:面向细粒度艺术品理解的智能体多模态艺术检索:论文配图
图 1. 对于开放式、用户指定的艺术品问题,静态检索与 A-MAR 之间的比较。静态方法检索平面、无序的上下文来响应查询,而 A-MAR 明确规划推理过程并跨模式检索特定步骤的证据,从而实现可解释和有依据的解释。