论文
视觉谎言,一致性说话:将空间注意力与视觉语言模型的可靠性分开
Visuals Lie, Consistency Speaks: Disentangling Spatial Attention from Reliability in Vision-Language Models
摘要
多模态基础模型越来越多地用作推理代理,这使得可靠性、了解模型何时可能产生幻觉变得至关重要。一种常见的直觉,我们称之为“注意力-置信度假设”,认为可靠性来自“结构性”视觉感知:对相关区域的集中注意力应该表明答案值得信赖,而分散的注意力则表明混乱。我们通过 VLM 可靠性探针 (VRP) 来挑战这一点,这是对当代视觉语言模型 (VLM) 中可靠性信号的系统性跨系列研究。我们引入结构注意力指标、簇计数 (C_k) 和空间熵 (H_s),以量化视觉编码器的注视,并跟踪其跨层的演化 (Delta H_s)。这揭示了一种“象征性分离”:模型通常“早期锁定”视觉特征只是为了分散以后的注意力,从而将早期感知与最终一代切断。与基础假设相反,我们发现了“集群故障”:空间注意力的准确度接近于零相关性(R 约 0.001)。相反,可靠性是一种生成动态和内部状态分布的现象。自我一致性,即采样推理路径的一致率,是真理的主要预测因子 (R = 0.429)。扩展因果干预暴露了明显的架构分歧:LLaVA 将其预测锁定在脆弱的后期瓶颈中,而 PaliGemma 和 Qwen2-VL 在全球范围内分配可靠性,即使在其最具预测性的层被破坏约 50% 或更多时也能保持弹性。对于当前的 VLM,可靠性信号与视觉定位图分离,最好从生成时动态和隐藏状态探针中推断出来。