论文

VLM 如何失败?组合 VQA 中的视觉与操作错位

How Do VLMs Fail? Vision-Operation Misalignment in Compositional VQA

模型评测模型行为与机制分析

摘要

组合视觉问答需要视觉语言模型(VLM)来执行多种推理操作,例如对象选择、空间关系解析和属性验证。尽管总体性能强劲,但 VLM 在此任务上失败的机制基础仍未得到充分探索。为了解决这一差距,我们通过检查故障与特定推理操作的关系以及它们产生和传播的内部计算路径来分析 VLM 中的视觉操作错位。我们引入了一个以操作为中心的机械框架,该框架通过故障产生的推理操作和它们传播的内部计算路径来分解 VLM 故障。我们的分析揭示了四种主要的失败模式:基础失败、推理失败、属性提取失败和语言先验优势,每种模式都以视觉基础强度和答案正确性之间的独特关系为特征。通过在所有 Transformer 层上应用三种互补的因果干预措施,我们发现对象选择失败主要与前馈计算相关,与后层直接注意的多步关系失败以及与答案位置前馈计算的属性提取失败相关。 VSR 的验证进一步表明,单步空间故障集中在对象位置编码上,将其与多步关系组合区分开来。这些发现揭示了不同操作类型之间的明显计算瓶颈,并为多媒体推理中 VLM 故障的针对性诊断提供了原则基础。