论文

ReactBench:测量MLLM在化学反应图上拓扑推理能力的基准

ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams

模型评测基准与评测资源

摘要

多模态大语言模型(MLLM)擅长识别单个视觉元素,并能对简单的线性图示进行推理。然而,当面对涉及分支路径、汇聚流与循环依赖的复杂拓扑结构时,其推理能力急剧退化,哪怕在数端点这样基础的任务上也不例外。现有基准未能探及这一缺口,它们聚焦于语义理解而非结构推理。我们提出 ReactBench,一个通过化学反应图揭示结构推理根本局限的基准。这些真实世界的科学图示提供了理想的试验场:它们天然覆盖从线性链到环形图的多样结构,同时要求精确的局部识别与连贯的全局推理。我们的基准包含 1,618 个经专家标注的问答对,分布在四个层次化的任务维度上。对 24 个 MLLM 的大规模评估显示,基于锚点的任务与整体性结构推理任务之间存在超过 30% 的显著性能差距。受控消融实验证实,这一瓶颈出在推理而非感知。这些发现暴露了结构理解上的根本缺陷,并为推进视觉推理确立了方向。

ReactBench:测量MLLM在化学反应图上拓扑推理能力的基准
图 2:ReactBench 概述。 ReactBench 跨四个复杂性分层维度系统地评估化学反应图的拓扑推理。