论文

COCOLogic-V2:通过真正的硬否定识别逻辑不一致

COCOLogic-V2: Identifying Logical Inconsistencies via Truly Hard-Negatives

模型评测基准与评测资源

摘要

虽然概念瓶颈模型 (CBM) 和程序综合方法等可解释模型可以验证模型决策,但它们的评估通常仅限于简单任务,而对现实世界图像的复杂推理在很大程度上尚未探索。我们介绍 COCOLogic-V2,这是一个以对象为中心的数据集,用于对现实世界图像进行视觉归纳推理,涵盖一阶逻辑的广泛子集。通过将样本分类为阳性变体、近边界 (NB) 和远离边界 (FB) 阴性变体,COCOLogic-V2 能够对模型责任进行细粒度诊断。我们的评估表明,模型往往能够很好地分离正样本和 FB 样本,但无法很好地分离 NB 样本,而感知噪声和大型规则引发的搜索空间在少样本设置中带来了额外的挑战。总之,这些结果强调视觉归纳推理仍然是一个开放的挑战,COCOLogic-V2 为朝这个方向推进方法提供了坚实的基础。