论文
超越盲目合规:OCR 推理中的基准测试任务验证
Beyond Blind Compliance: Benchmarking Task Verification in OCR Reasoning
摘要
多模态 大语言模型 (MLLM) 在以 OCR 为中心的文档理解和富含文本的视觉推理基准方面取得了出色的性能。然而现有的评估很大程度上假设每项任务都是有效且可负责的。在现实世界的 OCR 场景中,这种假设通常会失败:问题可能依赖于难以辨认的文本、遮挡的证据、不存在的视觉目标、矛盾的前提或缺失的变量。我们将这种可靠性差距研究为基于 OCR 的任务验证:在回答之前,模型应确定图像前提 (IP)、文本前提 (TP) 和问题 (Q) 是否共同定义可执行任务。我们推出了 VeriOCRBench,这是一个经过 1,800 个样本的人工验证基准,由来自 8 个 OCR 相关数据集的源图像构建,跨越 8 个真实世界图像域,具有受控的、基于图像的诊断任务。它包含 1,600 个陷阱注入的无效任务,涵盖 8 个陷阱类型和四个验证维度(视觉、上下文、事实和逻辑),以及 200 个用于测量过度拒绝的无陷阱控件。 VeriOCRBench 采用视觉原子事实 (VAF) 锚定管道和完整的人工审核构建,可实现任务验证、根本原因诊断和过度拒绝的解耦评估。对 15 个领先的 MLLM 的评估揭示了持续的盲目遵从、诊断失败和提示引起的过度拒绝,暴露了当前 OCR 推理系统中关键的可靠性差距。该代码位于:https://github.com/zy001122/Beyond-Blind-Compliance。