论文

视觉语言模型真的能进行视觉推理吗?对模态差距的严格研究

Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap

模型评测基准与评测资源

摘要

视觉语言模型(VLM)中的推理由于其在不同下游任务中的广泛适用性而最近引起了极大的关注。然而,目前尚不清楚 VLM 的卓越性能是源于真正的基于视觉的推理,还是主要依赖于其文本主干的推理能力。为了系统地衡量这一点,我们引入了 CrossMath,这是一种新颖的多模态推理基准,专为受控的跨模态比较而设计。具体来说,我们以纯文本、纯图像和图像+文本格式构建每个问题,以保证相同的任务相关信息,并由人工注释者验证。这种严格的对齐有效地隔离了特定于模态的推理差异,同时消除了信息不匹配等混杂因素。对最先进的 VLM 的广泛评估揭示了一个一致的现象:文本推理和视觉推理之间存在巨大的性能差距。值得注意的是,VLM 在纯文本输入方面表现出色,而与纯文本基线相比,合并视觉数据(图像+文本)经常会降低性能。这些发现表明,当前的 VLM 主要在文本空间中进行推理,对视觉证据的真正依赖有限。为了缓解这一限制,我们为 VLM 微调 策划了 CrossMath 训练集。实证评估表明,该训练集上的 微调 显着提高了所有个体和联合模式的推理性能,同时在两个一般视觉推理任务上产生了强劲的收益。源代码可在 https://github.com/xuyige/CrossMath 获取。