论文
超越语义的艺术:多关系表示的层知情对比学习
Art Beyond Semantics: Sheaf-Informed Contrastive Learning for Multi-Relational Representations
摘要
理解一幅画从来都不是一个单一的行为。艺术史学家可以通过风格、图像学或历史背景等概念来分析同一件作品,这些概念是不可互换的,并且每个维度都在视觉和文本之间承载着不同的语义关系。像 CLIP 这样的视觉语言模型 (VLM) 会学习单个共享嵌入空间,将这种丰富性压缩为单个同质对齐,从而失去定义艺术历史推理的多关系结构。我们介绍 CANVAS(用于视觉语言对齐与层的对比艺术感知网络),这是一个受层理论启发的学习关系感知多模态表示的框架。每件艺术品都根据关系类型(即上下文)投射到多个嵌入中,并且一种新颖的对比损失在训练期间对上下文信息进行编码,在推理时不依赖于外部数据。我们评估了三个新引入的多关系艺术理解艺术品基准:WikiArt+(源自 WikiArt 和 Wikipedia)、HertzianaDP(来自 Bibliotheca Hertziana 馆藏)以及 SemArt+(源自 SemArt 数据集)。在多模态检索和艺术理解中,CANVAS 的表现优于基线,这支持了这样的观点:多关系对齐不仅具有理论上的动机,而且实际上也很重要。