论文
MissingBench-Verified:探测视觉语言模型无法检测丢失的物体部分
MissingBench-Verified: Probing Vision-Language Models' Inability to Detect Missing Object Parts
摘要
视觉语言模型 (VLM) 因产生图像中不存在的物体的幻觉而闻名。由于现实世界的知识偏差和训练数据中此类图像的稀缺,缺少部分的物体对 VLM 提出了独特的挑战。我们推出了 MissingBench-Verified,这是一个旨在评估特定且实际相关场景的基准:当视觉语言模型无法识别物体的重要组成部分已被删除时。在十个主要模型中,我们观察到一致且显着的失败率,即使外部工具证据明确与模型的视觉感知相矛盾,失败率仍然存在。我们进一步询问授予模型访问图像处理工具(例如裁剪、对比度调整)是否能够实现自主检查来解决这些故障。我们发现现有的缓解策略,包括工具辅助验证、自主视觉推理、更长的推理持续时间以及在更简单的数据集上使用 微调,提供的改进可以忽略不计,表明这种故障模式无法通过当前的提示或事后纠正技术来解决。我们的研究结果强调了当前 VLM 对于检查和监控任务的根本局限性,并强调需要架构或训练级别的干预措施,使模型在遇到矛盾的证据时能够超越内部期望。