论文
字符错误向量:页面级 OCR 评估的可分解错误
The Character Error Vector: Decomposable errors for page-level OCR evaluation
摘要
字符错误率 (CER) 是评估光学字符识别 (OCR) 质量的关键指标。然而,该指标假设文本已被完美解析,但情况通常并非如此。在页面解析错误的情况下,CER 变得未定义,限制了其作为指标的使用,并使评估页面级 OCR 具有挑战性,特别是在使用不共享标签模式的数据时。我们引入字符错误向量 (CEV),这是一种用于 OCR 的字符袋评估器。 CEV 可以分解为解析和 OCR 以及交互错误组件。这种可分解性使从业者能够专注于文档理解管道中对整体文本提取质量影响最大的部分。 CEV 可以使用多种方法来实现,其中我们演示了 SpACER(空间感知字符错误率)和使用 Jensen-Shannon 距离的字符分布方法。我们根据其他指标验证 CEV 的性能:首先,与 CER 的关系;然后,解析质量;最后,作为页面级 OCR 质量的直接衡量标准。验证过程表明,CEV 是解析指标和 CER 等本地指标之间的宝贵桥梁。我们分析了由具有复杂布局的退化图像组成的档案报纸数据集,发现最先进的端到端模型的性能优于更传统的管道方法。虽然 CEV 需要字符级定位来实现最佳分类,但对容易获得的值进行阈值化可以预测主要错误源,F1 为 0.91。我们提供 CEV 作为 Python 库的一部分来支持文档理解研究。