论文
基于 OCR 的考古陶器元数据字段提取:CENTURIA 数据集
OCR-Based Field Extraction for Archaeological Pottery Metadata: The CENTURIA Dataset
摘要
陶器是重建过去社会的年代和经济维度的主要来源。考古学家经常通过技术图纸和手写元数据记录陶瓷发现。这些元数据对于约会、出处归属和跨站点比较至关重要,但仍然无法进行计算分析,需要手动转录每条记录。我们研究了最先进的文档分析模型是否可以解决此任务,并引入了 CENTURIA,这是来自卡农图姆罗马遗址的 507 个陶器记录的数据集,提供跨七个元数据类别的转录、边界框和结构化字段级标签。对五个 OCR 模型进行基准测试揭示了巨大的领域差距:零样本转录错误达到 SpACER-M 的 15-32%,远远超过印刷档案文档的错误率,特定领域字段的恢复率不到 3%。 LoRA 微调 仅适用于 57 个样本,反映了实际的档案注释预算,缩小了这一差距,将转录错误降低至 1.5% 以下,并将整体现场级准确度恢复到 87% 以上。我们的结果表明,经过专家验证的小型 微调 集足以将手写陶器文档转换为结构化、可搜索的元数据,为考古数据库做好准备。