论文

ClinOCR-Bench:用于光学字符识别模型评估的综合临床扫描文档数据集

ClinOCR-Bench: A Comprehensive Clinical Scanned Document Dataset for Optical Character Recognition Model Evaluation

模型评测基准与评测资源

摘要

从扫描的医疗文档(例如外部实验室报告和手动填写的表格)中提取文本信息一直是现代电子健康记录(EHR)中的一个主要挑战。视觉语言模型 (VLM) 的最新进展显示出比传统 OCR 工具更大的前景。然而,目前大多数临床 OCR 研究都是在私人机构数据上进行的。据我们所知,用于评估临床领域 OCR 模型的公开数据集很少。此外,破坏 OCR 性能的常见扫描伪影并未反映在这些数据集中,从而导致系统评估不可行。因此,我们发布了一个公开的、逼真的 OCR 基准数据集 ClinOCR-Bench,其中包含 6 个子集的 384 个扫描图像:正常、手写、质量较差、旋转、表格和混合工件。 ClinOCR-Bench 的特点:1) 多样化的文档类型和布局,2) 全面覆盖常见的 EHR 扫描工件,3) 不受保护的健康信息,4) 模板感知的训练/测试分割,以及 5) 用于 OCR 基准测试的足够的样本量。使用最先进的开放权重和专有 VLM 评估基线 OCR 性能。数据集和文档可在 GitHub (https://github.com/ClinOCR-Bench/ClinOCR-Bench) 上获取。