论文

跨时空僧伽罗文 OCR:页面级适应和历时分析

Cross-Temporal Sinhala OCR: Page-Level Adaptation and Diachronic Analysis

模型评测基准与评测资源

摘要

僧伽罗语是一种形态丰富的附标语,斯里兰卡约有 1600 万人使用该语言,迄今为止,还没有公开可用的页面级僧伽罗语 OCR 真实世界数据集。之前所有评估僧伽罗 OCR 模型的研究都使用了人工生成的数据。为了弥补这一差距,我们引入了 sinhala-ocr-lk-acts-1010,这是一个带注释的数据集,包含 1,010 个页面级图像及其转录,这些图像是从 1981-1989 年和 2000-2019 年出版的斯里兰卡立法法案中收集的,分为 707 个训练示例、101 个验证示例和 202 个测试示例。基于深度学习的视觉语言处理的三个模型,即 DeepSeek-OCR V1、DeepSeek-OCR V2 和 LightOnOCR-2-1B,在消费者和云 GPU 上进行的 8 次实验中使用 QLoRA 进行了微调。 LightOnOCR-2-1B 表现最好,在所有测试示例中实现了 1.05% 的 CER,优于最先进的开源 OCR 模型,如 Surya-OCR (8.84%) 和 Tesseract v5 (10.69%),以及商用 OCR 模型,如 Google Document AI (2.06%)。我们的结果表明,LightOnOCR-2-1B 在实际 OCR 任务中优于其他基线,并且在所有打印周期内保持一致的性能,即使文档严重退化也是如此。