论文

RealDocBench:对真实世界监管文档进行现场级 QA 和布局理解的基准

RealDocBench: A Benchmark for Field-Level QA and Layout Understanding on Real-World Regulated Documents

模型评测基准与评测资源

摘要

文档解析系统越来越多地部署在高风险、受监管的工作流程中,例如抵押贷款承销、财务报告、供应链物流和临床记录。然而,大多数公共基准测试都是在干净的学术布局或合成散文上评估解析器,并报告单个 OCR 或降价级别的相似性分数。此类文档和指标与下游代理实际需要的相关性很差:混乱的现实页面上特定字段的正确值。我们推出 RealDocBench,这是一个根据真实监管文档构建的双轨基准测试。 QA 轨道包含跨越四个领域的 581 个文档中的 1,356 个字段级问题,其中每个问题都与键值答案的类型化 gold_dict 配对,并且解析器根据每个字段和严格的每个问题的准确性进行评分。布局轨道包含 1,500 个经过人工验证的页面图像,在九类公共分类下用 COCO 风格的边界框注释,并使用匈牙利匹配器进行评分,其中包括邻接感知拆分/合并恢复。我们在统一的提取和评分协议下评估了 18 个系统,涵盖商业解析 API、通用 VLM 和开源 OCR 模型,并报告准确性以及每页成本和缓存破坏的延迟。 RealDocBench 揭示了单个数字基准测试隐藏的广泛性能差异、持续困难的医疗子领域以及跨操作点的尖锐成本/延迟权衡。我们发布了数据集、解析器适配器和评估工具,以支持文档解析系统的可重复的字段级比较。