论文

Hob-VL:基于视觉的布尔推理的基准

Hob-VL: A Benchmark for Visually Grounded Boolean Reasoning

模型评测基准与评测资源

摘要

可靠的视觉推理需要组合多个视觉观察结果,并对逻辑上等效的问题返回一致的答案。我们引入 Hob-VL,这是基于视觉的布尔推理的基准。 Hob-VL 包括两个任务:(1)评估图像中布尔规则是否成立,以及(2)识别满足布尔描述的(唯一)对象。 Hob-VL 包含 6,000 个经过人工验证的平衡的是/否问题,每个问题均由 10 个视觉陈述的布尔组合定义,涵盖 1,000 个生成的场景和 46 张不同的标记照片,以及针对同一照片的 1,000 个物体识别问题。我们的问题系列是故意构建的,旨在通过误导性的本地线索和嵌套的逻辑运算来挑战推理,并包括符号和结构化的自然语言表示。在8种禁用或最小化思维的模型配置中,布尔准确率范围为48.52%至50.57%,而识别准确率最高可达43.0%。具有思考能力的 GLM 配置可实现不均匀的收益,同时保留大量错误和不一致之处。 Hob-VL 通过可执行的参考答案和匹配的评估来暴露这些失败。