论文

用合作原则评测VLM的VQA

Evaluating VQA in Vision Language Models using Cooperative Principles

模型评测鲁棒性、公平性与可信度评测

摘要

我们评估视觉语言模型在问题违反格赖斯准则时的视觉问答(VQA)表现。为此我们用VLM生成添加非必要、模糊或虚假信息的问题修饰,展示在这种违规出现时,受评VLM(ChatGPT、Claude、Gemini与Llava)性能下降。我们进一步实证展示人类语用推理与VLM的差异,以及VLM解决人类诱导违规与AI生成违规时推理的差异。最后我们显示(以实验中任务时间测量的)人类认知努力在解决VLM诱导违规时更低,但VLM自身在这类情形下表现更不准。