论文
用结构化相关性图诊断视觉语言模型的因果推理
Diagnosing Causal Reasoning in Vision-Language Models via Structured Relevance Graphs
摘要
大型视觉语言模型(LVLM)在视觉问答基准上表现强劲,却常依赖虚假相关而非真正的因果推理。现有评估主要考察答案正确性,使人们无法判断失败究竟源于推理能力有限,还是源于未能识别因果相关的信息。我们提出 Vision-Language Causal Graphs(VLCgs),一种结构化、查询条件化的表示,显式编码因果相关的物体、属性、关系与扎根于场景的假设。基于该表示,我们提出 ViLCaR,一个包含因果归因、因果推理与问答任务的诊断基准,并配有与图对齐的评估指标,在最终答案准确率之外评估相关性识别。在最先进 LVLM 上的实验表明,注入结构化相关性信息相比零样本与标准上下文学习显著改善归因与推理一致性。这些发现表明,当前 LVLM 因果推理的局限主要源于结构性引导不足,而非推理能力欠缺。
