论文

GlotOCR Bench:OCR 模型仍然在少数 Unicode 脚本之外挣扎

GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts

模型评测基准与评测资源

摘要

随着视觉语言模型的兴起,光学字符识别 (OCR) 迅速发展,但评估仍然集中在一小群高资源和中等资源的脚本上。我们推出 GlotOCR Bench,这是一个评估 100 多个 Unicode 脚本的 OCR 泛化能力的综合基准。我们的基准测试包括从真实的多语言文本渲染的干净和降级的图像变体。图像使用 Google Fonts 存储库中的字体进行渲染,使用 HarfBuzz 进行整形并使用 FreeType 进行光栅化,支持 LTR 和 RTL 脚本。手动检查渲染图像的样本,以验证所有脚本的渲染是否正确。我们评估了一系列广泛的开放权重和专有视觉语言模型,发现大多数模型在少于十个脚本上表现良好,即使是最强大的前沿模型也无法泛化超过三十个脚本。性能广泛跟踪脚本级预训练覆盖范围,这表明当前的 OCR 系统对语言模型预训练的依赖与视觉识别一样多。模型面对不熟悉的脚本要么产生随机噪音,要么从他们已经知道的类似脚本中产生幻觉。我们发布了可重复性的基准和管道。管道代码:https://github.com/cisnlp/glotocr-bench,基准:https://hf.co/datasets/cis-lmu/glotocr-bench。