论文

转码器追踪视觉语言模型中的视觉基础和幻觉

Transcoders Trace Visual Grounding and Hallucinations in Vision-Language Models

模型评测模型行为与机制分析

摘要

生成视觉语言模型(VLM)在多模态推理方面表现良好,但人们对视觉输入如何转换为文本仍然知之甚少。 VLM 上现有的可解释性工作使用稀疏自动编码器 (SAE),它分解静态残差表示并错过驱动跨模式交互的功能更新。我们采用基于转码器的以功能为中心的框架,MLP 子层的稀疏近似充当逐层计算的因果代理。应用于 Gemma 3-4B-IT 时,该框架将模型分解为可解释的计算路径,将图像补丁与词元生成方向联系起来。与 SAE 属性相比,转码器属性在补丁消融下对视觉基础标记产生更强、更稳定的效果,并且与语义相关的图像区域更好地对齐。虚假视觉视觉证据关联反事实分析证实,恢复的路径特定于视觉语言交互。最后,我们通过从转码器产生的电路轨迹中提取基于图形的指标,对幻觉生成进行结构分析。基于这些机械图特征的逻辑分类器预测幻觉的 AUC 为 0.68 美元。这些结果表明,以功能为中心的电路分解产生了 VLM 中多模态计算的可解释和预测说明。