论文

OCR-元推理基准:评估 MLLM 在富文本图像理解中的元推理能力

OCR-MetaReasoning Benchmark: Evaluating the Meta-Reasoning Ability of MLLMs in Text-Rich Image Understanding

模型评测基准与评测资源

摘要

丰富文本的图像理解需要多模态 大语言模型 (MLLM) 来组织跨单词、布局、字段、图表和视觉对应的 OCR(光学字符识别)证据。现有的评估通常将提取与推理混为一谈,很少测试模型是否遵循所需的推理方向:应用可见规则、抽象隐藏规律或恢复丢失的前提。我们引入了 OCR-MetaReasoning,这是一种受控的单图像基准,它将演绎、归纳和溯因视为不同的方向,并将最终答案的正确性与推理过程的合规性分开。该基准包含 1,500 个经过验证的样本,采用平衡的“3×5”分类法,跨越三种推理类型和五个 OCR 对象类别,以及参考推理步骤、自动答案评分、元推理宏观评分 (MRMS) 和推理过程合规性评分 (RPCS)。对具有代表性的闭源和开源 MLLM 进行的实验表明,基于 OCR 的元推理还远未饱和:模型在可见规则应用和布局敏感推理方面举步维艰,而在精确匹配评估下,符合流程的基本原理可能会伴随错误的最终答案。代码可在 https://github.com/gengxuli/OCR-MetaReasoning 获取。