论文
了解 MLLM 如何使用词元激活图描述艺术品
Understanding How MLLMs Describe Artworks Using Token Activation Maps
摘要
多模态 大语言模型 (MLLM) 非常流畅地描述艺术品,但其输出背后的视觉推理仍然不透明。当 MLLM 命名一种风格、识别一个主题或识别一个图像符号时,它是否将每个主张都建立在画布的相关区域中,绘制无差别的视觉信号,还是主要依赖于文本先验?我们使用词元激活图(TAM)来研究这一点,它为每个生成的词元生成一个热图,将特定于该词元的视觉证据与先验上下文干扰隔离开来。将 TAM 应用到一组跨越多个时期和流派的精选绘画中,我们分析了五个语义上不同的标记类别的视觉证据对应模式:常见视觉对象、风格描述符、元数据、图像标记和情感表达。我们发现视觉证据依赖随标记语义的不同而有很大差异。我们进一步表明,MLLM 试图识别艺术品和艺术家,在艺术家归因方面比在标题预测中实现更高的准确性,在标题预测中,幻觉更频繁。最后,我们将 TAM 与 SAM~3 开放词汇分割进行比较。为了确保可重复性,我们在项目页面上发布了代码、实验配置、提示和定性结果:https://nicolafan.github.io/tamart/。