论文

编码但断开连接:在修补空值下分解视觉语言模型故障

Encoded but Disconnected: Decomposing Vision-Language Model Failures under a Patching Null

模型评测模型行为与机制分析

摘要

在三种视觉语言模型架构(LLaVA-1.5-7B、Qwen2.5-VL-7B、InternVL3-8B)中,我们报告了中间层可解释性的普遍负面发现。在 POPE(这三个架构共有的基准)上,中间层以 68-91% 的错误率对真实答案进行编码,但该信号对于最终预测而言并不具有因果关系:在所有三种架构的层级别以及在每头级别的三层中的两层上,残差流修补产生 0% 的非平凡翻转(Qwen:0/12,600 修补前向)。唯一的例外是 InternVL3 layer-20 head-2,它是一个非词汇、自参与的头,其效果仅限于该特定头 (p < 1e-4)。尽管为空,但错误在操作上分为三种故障模式——感知故障、编码但断开、先验覆盖——在所有三种架构上的可学习性超过 60%,并且架构的先验方向预测两种干预措施中的哪一种会引发特定于类别的响应。我们在预言机标签下报告这些缓解效果,作为类别在机械上真实的证据,而不是作为可部署的方法。