论文

Chronicles-OCR:汉字进化轨迹的跨时空感知基准

Chronicles-OCR: A Cross-Temporal Perception Benchmark for the Evolutionary Trajectory of Chinese Characters

模型评测基准与评测资源

摘要

Vision 大语言模型 (VLLM) 在现代文本丰富的视觉理解方面取得了显着的成功。然而,面对历史书写系统不断的形态演变,它们的感知鲁棒性在很大程度上仍未得到探索。现有的古代文本数据集通常关注孤立的历史时期,无法捕捉跨越数千年的系统性视觉分布变化。为了弥合这一差距并增强数字人文的能力,我们推出了 Chronicles-OCR,这是第一个综合基准,专门设计用于评估 VLLM 在汉字(称为“七文字”)完整进化轨迹上的跨时空视觉感知能力。该数据集与顶级机构领域专家合作策划,包含 2,800 张严格平衡的图像,涵盖从龟甲到纸质书法等高度多样化的物理介质。为了适应不同历史阶段的剧烈形态和拓扑变化,我们提出了一种新颖的阶段自适应注释范式。在此基础上,Chronicles-OCR制定了四项严格的定量任务:跨时期的文字识别、视觉参考的细粒度古文字识别、古文解析和文字分类。通过将视觉感知与语义推理分离,Chronicles-OCR 提供了一个权威平台来揭示当前 VLLM 的局限性,为强大的、具有进化意识的历史文本感知铺平了道路。 Chronicles-OCR 可在 https://github.com/VirtualLUOU​​CAS/Chronicles-OCR 上公开获取。