论文
VLM 是在看还是只是在说?揭开视觉复检的错觉
Are VLMs Seeing or Just Saying? Uncovering the Illusion of Visual Re-examination
摘要
视觉语言模型 (VLM) 在推理过程中经常会产生自我反思语句,例如“让我再次检查一下数字”。这些陈述是否会引发真正的视觉重新审视,或者它们只是习得的文本模式?我们通过 VisualSwap(一种图像交换探测框架)对此进行研究:在模型对图像进行推理之后,我们将其替换为视觉上相似但语义上不同的图像,并测试模型是否注意到。我们引入了 VS-Bench、MathVista、MathVerse、MathVision 和 MMMU-Pro 精选的 800 个图像对。 Qwen3-VL、Kimi-VL 和 ERNIE-VL 上的实验揭示了一个惊人的失败:模型绝大多数都错过了交换,准确率下降了高达 60%。与直觉相反,思维模型比受指导的模型脆弱近 3 倍,而且扩展并不能缓解这种情况。多轮用户指令恢复视觉基础,但连续生成期间自生成的反射语句则不能。注意力分析解释了原因:用户指令大大提高了对视觉标记的注意力,而自我反思则不然。当前的 VLM 在声称进行视觉复查时倾向于说而不是实际看到。我们的代码和数据集可在项目页面获取:https://visualswap.github.io