论文
OCR 推理有多稳健?评估视觉扰动下视觉语言模型的 OCR 推理鲁棒性
How Robust is OCR-Reasoning? Evaluating OCR-Reasoning Robustness of Vision-Language Models under Visual Perturbations
摘要
视觉语言模型 (VLM) 在基于 OCR 的基准测试中取得了出色的性能,并且越来越关注丰富文本的理解,但它们在受控视觉退化下的鲁棒性仍然未被充分理解。这种差距对于 OCR 推理至关重要,视觉损坏会导致 OCR 错误和结构扭曲,从而给推理任务带来不确定性。为了系统地研究这个问题,我们引入了 OCR-Robust,这是一个旨在评估视觉扰动下 OCR 推理鲁棒性的基准。它包含跨越两个互补子集的 812 个样本:OCR1.0,涵盖文档、场景文本、收据、手写和数学内容,以及 OCR2.0,重点关注图表、几何图和表格。为了实现高效且信息丰富的评估,我们对 18 种候选扰动进行了试点研究,并根据其影响和跨模型辨别能力选择了 3 个严重级别的 5 种代表性类型。我们使用干净准确度、相对腐败保留 (RCR)、最坏情况保留 (WCR) 和综合腐败鲁棒性指数 (CRI) 以及涵盖专有系统、开源 VLM 和 OCR+LLM 管道的基准 18 个模型来评估鲁棒性。我们的结果表明,更高的清洁精度并不一定意味着更强的鲁棒性,并且在最坏的情况下,在对结构敏感的 OCR 任务上,模型可能会遭受明显的退化,并且图表和表格在扰动下比类似文档的输入要脆弱得多。