论文

当良好的 OCR 还不够时:检索增强生成的 OCR 鲁棒性基准测试

When Good OCR Is Not Enough: Benchmarking OCR Robustness for Retrieval-Augmented Generation

模型评测基准与评测资源

摘要

工业检索增强生成 (RAG) 系统依靠光学字符识别 (OCR) 将视觉文档转换为文本。现有的 OCR 基准依赖于字符级指标,这不足以衡量现实条件下下游 RAG 的有效性。我们为工业 RAG 系统引入了 OCR 基准,涵盖 11 种具有挑战性的文档类型,包括极端布局、高分辨率页面、复杂或带水印的背景、具有非标准阅读顺序的历史文档、视觉装饰文本以及包含表格和数学公式的文档。在受控的 OCR-first RAG 管道下评估最新的 SOTA OCR 模型显示,尽管传统基准分数很高,但实际工业文档的性能明显下降。我们发现,高 OCR 准确度并不一定会转化为强大的下游 RAG 性能:即使 WER/CER 仍然较低,结构和语义错误也可能导致严重的检索失败。进一步的分析表明,这种不匹配与类别相关,是由检索端和下游生成端故障引起的,并且在代表性的 OCR 优先管道选择中保持稳定。该基准测试可在 https://github.com/Qihoo360/InduOCRBench 上公开获取。