论文
Ancient-Bench:跨千年、多媒介、多文字的中国古代文物文本识别综合基准
Ancient-Bench: A Comprehensive Multi-millennial, Multi-medium, and Multi-script Benchmark for Ancient Chinese Artifact Text Recognition
摘要
中国古代文物文本识别是遗产数字化的基础,而古代文本的基准对于评估当前模型的能力至关重要。然而,现有的基准测试存在“碎片化”问题,表现为时间覆盖范围有限、介质多样性有限以及脚本类型不完整。因此,我们提出了Ancient-Bench,这是一个包含2700张图像的中国古代文物文字识别的综合基准,具有三个维度:多千年(跨越3000年的文字演变)、多媒体(涵盖九个文物类别)和多文字(涵盖七种历史文字形式)。为了实现跨异构媒体的一致和公平的评估,我们进一步定义了针对古代文本媒体特定特征的三种注释标准:符号标准化、字符标准化和解析标准化。 Ancient-Bench 上涵盖通用视觉语言模型 (VLM) 和 OCR 专业模型的广泛实验表明,古代中国文物文本识别仍未从根本上得到解决,在变体字符、特殊符号和幻觉方面持续存在挑战。该数据集可在 https://github.com/SCUT-DLVCLab/Ancient_Bench 获取。