论文

视觉语言因果推理中的抽象差距

The Abstraction Gap in Vision-Language Causal Reasoning

模型评测评测方法与指标

摘要

视觉语言模型(VLM)可以生成流畅的因果解释,但目前的评估无法区分语言合理性和忠实的因果推理。我们引入了一种双探针方法来隔离这些属性。纯文本探针测量语言质量。链文本探针需要模型首先生成明确的因果链。抽象差距 (AG) 指标量化了标准化的性能差异。在 CAGE(因果抽象差距评估)(涵盖 Pearl 因果层次结构的 5,500 张图像中 49,500 个问题的基准)上评估 8 个 VLM,我们发现 7 个模型的 AG 超过 0.50,文本得分为 6--8,但链得分低于 2.5。 微调 在 45,000 个链注释示例上未能缩小差距。然而,一种模型实现了接近于零的 AG。该功能存在于当前的 VLM 架构中,并且取决于预训练和架构选择。 CAGE 提供了一种诊断工具,用于评估 VLM 中忠实的因果推理。