论文
真实图像,更糟糕的判断:评估具体性和图像性的视觉语言模型
Real Images, Worse Judgments: Evaluating Vision-Language Models on Concreteness and Imagery
摘要
通常认为视觉输入可以提高多模态模型中的语言理解。我们通过询问视觉语言模型(VLM)是否可以在词汇判断中区分有用的视觉证据和附带的图像上下文来检验这一假设。我们使用人类具体性和意象评级,因为它们涵盖了具有不同预期视觉相关性的单词,从抽象和低意象单词到具体和高意象单词。我们发现,真实图像环境不会产生一致的增益,并且常常会损害与人类评分的一致性,当视觉证据最不相关时,情况最为严重。通过探索和典型相关分析,并辅以归因案例研究,我们发现真实图像上下文与表征转变和对虚假视觉线索的更高敏感性相关,而与目标词汇属性的可恢复性较弱相一致。我们进一步表明,指示模型在推理时仅关注文本内容可以减少这种退化,并对这些脆弱子集带来最明显的收益。我们的研究结果表明,当前的指令调整 VLM 需要更好地校准视觉上下文何时应告知词汇判断。