论文

综合数据泰语 OCR 能走多远?

How Far Can Synthetic Data Take Thai OCR?

模型训练合成数据

摘要

我们研究了如何将合成 OCR 监督转移到真实的泰语文档,并利用由此产生的见解构建 Wayu-Paxa-OCR-Zero,这是一种泰语 OCR 模型,无需来自真实泰语文档页面的 OCR 标签。合成数据提供了大规模的精确标签,但“现实主义”将源域、页面上下文、排版、空间结构和字形变化混为一谈。我们通过受控的文档重建管道来理清这些因素,并在印刷和手写泰语文档的页面和作物级别训练下评估每个变体。非文本上下文几乎没有一致的效果,而字体多样性、二维结构和真实的手写字形可以改善迁移;此外,源域匹配取决于训练粒度,域内重建在页面级训练下接近真实打印监督(中位字符错误率分别为 1.82% 和 1.31%),但在作物级训练下表现不佳(15.59% 和 5.52%)。在这些发现的指导下,我们使用 45,723 个合成页面将 0.9B 参数 PaddleOCR-VL-1.6 调整为 Wayu-Paxa-OCR-Zero:相对于其基本检查点,它将打印页面的中位字符错误率从 6.64% 降低到 1.24%,手写错误率从 74.87% 降低到 20.55%,并且优于 Typhoon OCR v1 7B在所有五个评估集上,表明纯合成训练可以具有竞争力。