论文

VisualScratchpad:视觉语言模型的推理时视觉概念分析

VisualScratchpad: Inference-time Visual Concepts Analysis in Vision Language Models

模型评测模型行为与机制分析

摘要

高性能的视觉语言模型仍会产生错误答案,但其失败模式往往难以解释。为使模型内部更可访问并支持系统化调试,我们提出VisualScratchpad,一个用于推理期间视觉概念分析的交互式界面。我们对视觉编码器应用稀疏自编码器,并通过文本到图像的注意力将所得视觉概念与文本token关联,从而检查哪些视觉概念既被视觉编码器捕获又被语言模型利用。VisualScratchpad还提供token-潜变量热图视图,提示一组足以在因果分析中进行有效概念消融的潜变量。通过案例研究,我们揭示三种欠探索的失败模式:有限的跨模态对齐、误导性视觉概念和未被利用的隐藏线索。项目页面:https://hyesulim.github.io/visual_scratchpad_projectpage/。

VisualScratchpad:视觉语言模型的推理时视觉概念分析
图1:VisualScratchpad流水线。A. 在视觉-语言模型推理过程中,我们从视觉编码器提取中间表示 z。B. 一个稀疏自编码器处理 z 以产生概念激活。从输出文本token到图像token的注意力图在patch层级上应用,为这些激活加权。随后,在输出token上表现出相似激活模式的潜变量(latent)被聚类,并以token–latent热图的形式可视化。C. 这些概念对模型输出的因果影响可通过潜变量消融来评估。