论文

VLM 何时有助于阿拉伯文手稿 OCR?跨数据集研究

When Do VLMs Help Arabic Manuscript OCR? A Cross-Dataset Study

模型评测模型能力评测

摘要

视觉语言模型 (VLM) 越来越多地用于文档理解,但它们在阿拉伯语和伊斯兰手稿识别中的作用仍未得到充分探索。为了解决本文中的这一差距,我们在八个阿拉伯文本数据集(涵盖历史手稿、旧印刷书籍、干净印刷、多域文档和手写体)中评估了传统 OCR、通用 VLM、阿拉伯语专用 VLM 和 OCR 条件 VLM 校正。结果表明,没有一种方法可以在各种设置中占主导地位。在行级历史手稿上,VLM 接近 Tesseract;在页面级手稿图像上,它们表现更好;在多种设置中,OCR 调节校正器比独立 OCR 和独立 VLM 都有改进。核心发现是 OCR 先验可恢复性原则:当 OCR 输出保持视觉和文本可恢复性时,OCR 调节会有所帮助,提供 VLM 可以针对图像进行细化的锚点。它提高了对旧印刷体、干净印刷体、混合域阿拉伯语和一些纳斯赫手稿的识别,但当先验文本不匹配或系统性误导时,例如马格里布手稿和现实的学生笔迹,它会降低性能。其他诊断显示阿拉伯语 VLM-OCR 对变音符号、预处理、生成预算和重复循环敏感。这些发现支持自适应 OCR-VLM 工作流程,该工作流程根据脚本、OCR 优先可恢复性、长度诊断和故障模式指示器来路由页面。