论文
TongGuOCR:面向中文历史文献的布局感知与token增强OCR多模态大语言模型
TongGuOCR: A Layout-Aware and Token-Augmented OCR MLLM for Chinese Historical Documents
摘要
中文历史文献承载着宝贵的文化遗产,但许多馆藏仍只能以扫描页面图像的形式获取,阻碍了全文检索、校勘与计算分析。光学字符识别(OCR)可以弥合这一鸿沟,但准确转录仍然充满挑战,因为历史文献通常包含复杂版式、生僻字以及不平凡的阅读顺序。我们提出TongGuOCR,一个面向中文历史文献OCR的布局感知、token增强的多模态大语言模型(MLLM)。首先,布局感知预处理(Layout-Aware Preprocessing)模块构建并精化局部连贯的识别块,在保留局部上下文的同时减少跨区域干扰。其次,token增强识别(Token-Augmented Recognition)模块在两个互补层面对转录目标进行增强:字符级词表扩展为每个生僻字形提供直接的单token表示并缩短其解码路径,而行间转移建模注入离散的空间位移token,在无需精确坐标的情况下引导解码器沿复杂阅读路径行进。在两个中文历史文献OCR基准上的实验表明,TongGuOCR优于代表性的传统任务专用OCR模型、通用MLLM以及面向OCR的MLLM。在更具挑战性的M5HisDoc基准上,TongGuOCR达到93.76 AR,并在各指标上相对最优竞争成绩将NED从10.43降至6.15、RO-ED从7.53降至3.49。在线演示见 https://jzzh2004.github.io/TongGuOCR。
