论文
CCRV-Bench:以约束检验视觉因果推理
CCRV-Bench: Constraint-Based Evaluation of Causal Reasoning in Vision-Language Models
摘要
视觉语言模型(VLM)在视觉任务中表现出了优异的性能,但其视觉因果推理能力仍然缺乏可靠的评估。现有的评估很难区分模型是基于视觉证据进行因果推理,还是依赖统计相关性进行捷径学习,从而可能高估了其实际能力。本文提出了 CCRV-Bench,一种针对单图像物理场景的约束驱动视觉因果推理基准。我们构建了一个正交框架来评估四个因果任务维度:因果关系发现、状态预测、因果诊断和干预。我们进一步引入实体符号化、空间基础、事实对抗性约束和极简输出约束,以减少捷径线索,同时保留任务所需的物理常识。跨 15 个多模态模型的实验表明,约束敏感性是任务和模型相关的:干预在四个因果任务中具有最大的平均有效退化,空间空间定位是平均最具破坏性的约束,事实对抗性约束提高了所有评估模型的 DCR。这些结果表明,不受约束的性能并不能决定受约束的鲁棒性,并且单个总分可以掩盖因果识别、空间基础和符合约束的表达中的明显失败。 CCRV-Bench 提供了一个标准化框架,用于在受控约束下诊断基于图像的因果推理。代码位于 https://github.com/0815linyuan/CCRV-Bench-Constraint-Based-Evaluation-of-Causal-Reasoning-in-Vision-Language-Models
