论文

CC-OCR V2:现实世界视觉文档理解中 LMM 失败的细粒度归因

CC-OCR V2: Fine-Grained Attribution of LMM Failures in Real-World Visual Document Understanding

模型评测基准与评测资源

摘要

最近的大型多模态模型 (LMM) 在以 OCR 为中心的文档理解和处理任务方面取得了显着进展。现有基准主要评估跨不同任务的 LMM,以反映实际的文档处理工作流程或分析文档特征如何影响模型性能。然而,它们对现实世界文档采集条件下 LMM 可靠性的了解有限,其中照明、屏幕显示、成像质量和捕获方法等因素可能会严重影响性能。为了弥补这一差距,我们推出了 CC-OCR v2,这是一个用于归因现实文档处理中 LMM 故障的综合基准。 CC-OCR v2提供了统一的评估框架,涵盖5个核心文档处理能力、16个子任务、74个应用场景和7,093个样本。该基准涵盖识别套件中的五个评估轨道、十个文档类别和 32 种语言。除了任务级评估之外,每个样本还用十个细粒度文档因素进行注释,从而能够跨文档类型和采集条件对模型失败进行系统归因。对 17 个代表性 LMM 进行的广泛实验揭示了任务、文档类别和现实条件之间的巨大性能差异。此外,具有可比总体精度的模型通常在特定文档因素下表现出根本不同的故障模式,凸显了基准级性能与实际应用中的可靠部署之间的显着差距。数据集和评估工具包可在 https://github.com/eioss/CC-OCR-V2 上公开获取。