论文

LADBench:图像中逻辑故障检测的基准

LADBench: A Benchmark for Logical Fault Detection in Images

模型评测基准与评测资源

摘要

大视觉语言模型 (VLM) 擅长视觉问答和语义定位,但其自主逻辑推理的能力仍未得到充分开发。现有的异常基准强调视觉错误或直接提示,而不是开放世界部署所需的物理和社会常识。为了解决这个问题,我们引入了 LAD-bench,这是一个包含 1,000 多张精选合成图像的基准,这些图像具有跨四个领域的逻辑异常:住宅、城市、协作和自然。我们进一步提出了一种基于渐进式披露的分层提示协议,该协议衡量模型需要多少显式帮助来定位和推理逻辑错误。评估领先的基础模型揭示了巨大的弱点:即使是最好的模型也只能达到 70.11% 的整体准确率,这表明隐式逻辑故障检测仍然没有解决。至关重要的是,即使在更深层次中收到明确的提示后,模型通常也无法识别异常。通过解决顺序多模态推理中的这些局限性,LAD-Bench 提供了一个严格的框架,用于提高自主视觉系统的安全性、可靠性和认知一致性。数据集和代码:https://huggingface.co/datasets/SahasraK/LADBench