论文

OCR-EDR:用于闭环 OCR 改进的渲染感知诊断和修复

OCR-EDR: Rendering-Aware Diagnosis and Repair for Closed-Loop OCR Improvement

模型推理推理验证与自校正

摘要

尽管文档 OCR 系统在常规文档上的表现越来越好,但复杂的公式、结构化文本和长尾格式仍然容易出错。 OCR 预测可能会忽略细粒度的内容或产生不支持的输出,而必须适应相同可见内容的等效编码。现有的 OCR 评估方法大多报告聚合指标,为分析案例级错误和提高 OCR 性能提供有限的支持。我们提出了 OCR-EDR(OCR 错误诊断和修复),这是一种渲染感知框架,从细粒度诊断发展到迭代修复。给定源图像、可编辑的 OCR 预测及其渲染图像,OCR-EDR 首先联合评估预测及其渲染是否与源一致,保留有效的预测,包括渲染等效的预测,同时诊断和定位真正的错误。然后,它应用可执行编辑,并可能请求更新的渲染以进行迭代重新评估。我们根据各种真实的 OCR 预测构建 OCRErrBench,涵盖文本和公式、精确和渲染等效的正值以及真正的错误,并开发 DocEDR 模型来执行诊断-修复循环。在 OCRErrBench 上,DocEDR 的诊断准确率达到 94.78%。它修复了 86.23% 的视觉一致性错误输入,在 DOCRcaseBench 上将公式 Case-F1 比 DOCR-Inspector-7B 提高了 30.99 个百分点,并将在 UniMER-Test 上识别的四个 OCR 系统的坏子集上的公式 CDM 提高了高达 4.62 个百分点。这些结果表明,OCR-EDR 将细粒度 OCR 分析转化为经过验证的校正和性能增益。