论文

OCR-VLM 可以读取梵文吗?压力测试基准和校正后研究

Can OCR-VLMs Read Devanagari? A Stress-Test Benchmark and Post-Correction Study

模型评测基准与评测资源

摘要

OCR 系统,从经典引擎到专门的 OCR 视觉语言模型 (OCR-VLM) 和前沿多模态 LLM,在英语和中文文档基准上报告了强劲的结果,但它们在印度文字上的行为基本上没有特征。我们在梵文(印地语)上对十个系统进行了基准测试:经典的 EasyOCR;打开 VLM(Qwen2.5-VL-3B、Qwen3-VL-8B、olmOCR-7B);专门的 OCR-VLM(DeepSeek-OCR、Unlimited-OCR);和前沿封闭模型(Gemini 2.5 Flash、Claude Opus 4.7、GPT-5.5、Mistral OCR),跨越四种合成降解条件和 300 个真实打印扫描。我们报告了四项发现。首先,在干净的渲染文本上,所有十个簇都在 chrF++ 91 到 98 内,因此合成文本不会将它们分开。其次,在退化情况下,专门的 OCR-VLM 是最脆弱的:DeepSeek-OCR 会遭受罕见但灾难性的重复失败(输出高达参考长度的 71),这会破坏其语料库的平均值,尽管它的中位数是所有系统中最好的,这就是为什么我们报告中位数和灾难性比率而不是平均值。第三,在实际扫描中,十个系统中的九个崩溃了(EasyOCR 从 chrF++ 93.6 下降到 58.3),并且该字段分布在 76 点范围内,因此合成渲染严重夸大了梵文质量。第四,强英语 OCR 无法预测印度语 OCR:GPT-5.5 下降至 chrF++ 58.5(与经典 EasyOCR 持平),olmOCR-Bench 背后的模型 olmOCR-7B 下降至 40.5,而开放的 Qwen3-VL-8B(75.2,可在单个 24 GB GPU 上运行)击败 GPT-5.5 并接近 Mistral; Gemini 和 Claude 分别以 86.3 和 82.2 领先。错误分类法将表面错误(数字、标点符号)与结构错误(连词、矩阵、nukta)分开,字节级 (ByT5) 后校正器改进了廉价引擎自身的错误分布(chrF++ +1.2 到 +1.5),但不会跨引擎传输。我们发布基准、代码和模型。