论文

TongGuOCR:面向中文历史文献的布局感知与token增强OCR多模态大语言模型

TongGuOCR: A Layout-Aware and Token-Augmented OCR MLLM for Chinese Historical Documents

模型训练监督微调与指令调优

摘要

中文历史文献承载着宝贵的文化遗产,但许多馆藏仍只能以扫描页面图像的形式获取,阻碍了全文检索、校勘与计算分析。光学字符识别(OCR)可以弥合这一鸿沟,但准确转录仍然充满挑战,因为历史文献通常包含复杂版式、生僻字以及不平凡的阅读顺序。我们提出TongGuOCR,一个面向中文历史文献OCR的布局感知、token增强的多模态大语言模型(MLLM)。首先,布局感知预处理(Layout-Aware Preprocessing)模块构建并精化局部连贯的识别块,在保留局部上下文的同时减少跨区域干扰。其次,token增强识别(Token-Augmented Recognition)模块在两个互补层面对转录目标进行增强:字符级词表扩展为每个生僻字形提供直接的单token表示并缩短其解码路径,而行间转移建模注入离散的空间位移token,在无需精确坐标的情况下引导解码器沿复杂阅读路径行进。在两个中文历史文献OCR基准上的实验表明,TongGuOCR优于代表性的传统任务专用OCR模型、通用MLLM以及面向OCR的MLLM。在更具挑战性的M5HisDoc基准上,TongGuOCR达到93.76 AR,并在各指标上相对最优竞争成绩将NED从10.43降至6.15、RO-ED从7.53降至3.49。在线演示见 https://jzzh2004.github.io/TongGuOCR。

TongGuOCR:面向中文历史文献的布局感知与token增强OCR多模态大语言模型:论文配图
图1:展示中文历史文档OCR挑战的识别结果。输入图像中的白色虚线框标出了用于阅读顺序与转录对比的区域。该示例包含类表格版式、非平凡的阅读顺序和生僻历史字符。我们将TongGuOCR与代表性OCR系统进行比较,包括HanDoc-OrderOCR [14]、HunyuanOCR [15]和GLM-OCR [16]。箭头可视化了与源区域对齐的阅读路径,红色字符表示识别错误或顺序相关的错配。在该案例中,TongGuOCR遵循页面自然阅读顺序,并准确转录了所选内容。