论文

视觉 Transformer 怎样以转喻电路理解抽象概念

Metonymic Circuits for Abstract Concept Grounding in Vision Transformers

模型评测模型行为与机制分析

摘要

我们研究当训练数据提供有限的直接参考证据时,视觉变形金刚如何基础抽象概念(例如,愤怒)。我们假设一种转喻基础机制,其中抽象预测由具体的、可解释的锚概念(例如火)驱动,这些概念将视觉信号与抽象语义联系起来。通过在 CLIP 和 DINO 视觉编码器上应用转码器,我们恢复了可以与更具体概念的语义标签相关联的中间特征,并追踪它们在抽象概念识别背后的电路中的贡献。在精心策划的图标数据集上进行的实验揭示了结构化的转喻电路,其中感知基元主导早期层,类物体锚先于抽象目标。相反,包含渲染文本的图像会采用独特的感知到文本的路径。因果干预进一步证实转喻中间体在功能上参与了抽象概念的基础。

视觉 Transformer 怎样以转喻电路理解抽象概念:论文原图
图 1:OpenCLIP(Ilharco 等人,2021)训练字幕(Gadre 等人,2023,DataComp-1B;)中的词频密度,按词汇具体性分层。使用 Brysbaert 等人的规范,为每个单词分配从 1(抽象)到 5(具体)的具体性分数。 (2014);单词对按其标题文档频率加权的密度有贡献。