论文

学习艺术品和照片构图分析的视觉表征

Learning visual representations for compositional analysis of artworks and photographs

模型评测模型能力评测

摘要

构图,即视觉元素的故意排列,是艺术作品中如何传达意义、情感和审美品质的核心,但它仍然是视觉理解中最不正式的维度之一。之前的工作强调了学习有意义的构图表示方面持续存在的差距,将其归因于语义偏差,并表明受人类启发的方法可能是关键。我们比较了构图分析的两种并行范例:基于感知分组的受人类启发的方法,以及由最近的大规模构图数据集启用的微调基础模型。受人类启发的方法使用以对象为中心的模型进行区域级分解,并使用图注意网络来捕获元素之间的空间关系。这两种范式都根据构图评分/类别预测、构图图像检索和视觉显着性检测进行评估。通过冻结编码器,受人类启发的方法在保持可解释性的同时实现了有竞争力的性能。当足够的数据支持 微调 时,大型自监督模型的性能显着提高,但代价是可解释性和跨域泛化。代码和预训练模型可在 GitHub 上获取。