论文
多模态大语言模型内部视觉表征的因果探测
Causal Probing for Internal Visual Representations in Multimodal Large Language Models
摘要
尽管多模态大语言模型(MLLM)在不同的任务中取得了显着的成功,但控制它们如何编码和基础不同视觉概念的内部机制仍然知之甚少。为了弥补这一差距,我们提出了一种基于激活转向的因果框架,以主动探测和操纵内部视觉表示。通过对四个视觉概念类别的系统干预,我们的结果揭示了概念编码的分歧:实体表现出独特的局部记忆,而抽象概念则分布在整个网络中。至关重要的是,这种分歧揭示了缩放定律的机械驱动因素:增加模型深度对于编码分布式和复杂的抽象概念是必不可少的,而实体本地化对于缩放仍然具有显着的不变性。此外,反向引导揭示了阻止显式输出会触发潜在激活的激增,从而暴露了感知和生成之间的补偿机制。最后,将我们的分析扩展到视觉推理,我们暴露了感知和推理之间的脱节,尽管 MLLM 成功地识别了几何关系,但它们仅仅将它们视为静态视觉特征,无法触发解决抽象问题所需的程序执行。
