论文

PragMatch:将大型视觉语言模型中的语用不一致与跨模式不匹配分开

PragMatch: Separating Pragmatic Incongruity from Cross-Modal Mismatch in Large Vision-Language Models

模型评测基准与评测资源

摘要

大型视觉语言模型 (LVLM) 在多模态基准上表现出了强大的性能,但仍不清楚它们是否真正推理图像和文本之间的关系,还是依赖于表面相关性(称为快捷学习)。这个问题对于多模式讽刺检测尤其重要,其中成功的预测取决于识别语用不一致,而不是将讽刺视为简单的图像文本不匹配。我们引入了 PragMatch,这是一个源自 MMSD2.0 的 3,000 个图像文本对的受控基准,包括原始讽刺示例以及构造的文字和硬负对。我们通过系统掩蔽识别有影响力的捷径线索,并通过有针对性的注射实验评估其影响。我们的结果表明,LVLM 预测对词汇、OCR 衍生和文体线索敏感,尽管底层图像-文本关系不变,但注入的表面信号会导致模型预测发生重大变化。我们的研究结果揭示了当前 LVLM 的局限性,而 PragMatch 提供了一个系统测试平台,用于评估超越表面级图像文本对齐的多模态实用推理。