论文
通过认知预期场景图对 MLLM 进行基准测试,以实现安全关键的视觉否定理解
Benchmarking MLLMs via Cognitive Expected Scene Graph for Safety-Critical Visual Negation Understanding
摘要
真正的机器智能需要超越被动像素配准,通过视觉否定理解掌握对缺失信息的自上而下的功能推理。然而,不受约束的视觉否定范例仍然过于开放,普遍存在的肯定偏差导致现有的多模态大型语言模型(MLLM)和评估指标在否定语义下失败。为了系统地解决这些相互交织的挑战,我们首先将否定推理的边界锚定在特定的认知目标内。具体来说,通过将安全视为高度务实和关键的认知维度,我们定义了 \textbf{S}cene \textbf{N}egation \textbf{U}understanding 在 \textbf{S}afety Cognition (\textbf{SNUS}) 下的任务。在此框架下,我们构建了一个高保真负标题数据集,映射局部危险的密集断言。同时,我们提出了认知预期场景图(CESG)分数,这是一种基于结构的、极性感知的评估指标。大量的实验表明,虽然当前的模型在这项任务上举步维艰,但传统的指标在语义逆转下完全崩溃了。相反,我们的框架为 SNUS 提供了坚实的基准,为推进风险意识情境理解和反事实认知提供了严格的基础。