论文

多模态大语言模型内部视觉表征的因果探测

Causal Probing for Internal Visual Representations in Multimodal Large Language Models

模型评测模型行为与机制分析

摘要

尽管多模态大语言模型(MLLM)在不同的任务中取得了显着的成功,但控制它们如何编码和基础不同视觉概念的内部机制仍然知之甚少。为了弥补这一差距,我们提出了一种基于激活转向的因果框架,以主动探测和操纵内部视觉表示。通过对四个视觉概念类别的系统干预,我们的结果揭示了概念编码的分歧:实体表现出独特的局部记忆,而抽象概念则分布在整个网络中。至关重要的是,这种分歧揭示了缩放定律的机械驱动因素:增加模型深度对于编码分布式和复杂的抽象概念是必不可少的,而实体本地化对于缩放仍然具有显着的不变性。此外,反向引导揭示了阻止显式输出会触发潜在激活的激增,从而暴露了感知和生成之间的补偿机制。最后,将我们的分析扩展到视觉推理,我们暴露了感知和推理之间的脱节,尽管 MLLM 成功地识别了几何关系,但它们仅仅将它们视为静态视觉特征,无法触发解决抽象问题所需的程序执行。

多模态大语言模型内部视觉表征的因果探测
图 1:我们的因果框架的图示。我们通过配对图像(有概念和没有概念)之间的对比激活分析来提取概念向量 Δ \Delta 来研究视觉信息的编码。通过在推理过程中将向量 Δ \Delta 注入到模型中,我们验证了这种干预是否因果地诱导了相应的内部意识,从而揭示了 MLLM 中视觉表示的机制。