论文
DocOCR-Eval:基于校正的 OCR 工具选择框架,无需 真值
DocOCR-Eval: A Correction-Based Framework for OCR Tool Selection Without Ground Truth
摘要
文档解析是视觉问答和关键信息提取等文档理解任务的基础步骤,因为它通过提取文本、视觉和布局信息将非结构化扫描图像转换为结构化表示。尽管为此目的开发了许多光学字符识别 (OCR) 引擎和多模式 大语言模型 (MLLM),但为给定文档集合选择合适的文档解析解决方案仍然具有挑战性,特别是在标签稀缺的环境中。在这项工作中,我们在跨越不同领域和语言的多个扫描文档基准上,对各种 OCR 引擎和最先进的 MLLM 的文本识别性能进行了系统评估。由于许多 OCR 引擎的上下文推理能力有限以及手动注释的高成本,我们提出了 DocOCR-Eval,这是一种用于自动 OCR 评估和选择的无注释评估框架。 DocOCR-Eval 采用三阶段校正和排名策略来近似基于注释的工具排序,无需 真值 标签。我们表明,跨多个 MLLM 的聚合逐渐改善了与基于注释的排名的一致性。大量实验进一步证明,可以在现实的、标签有限的设置中实现可靠的 OCR 工具选择,为跨不同的现实世界文档集合部署文档解析系统提供实用指导。