论文

从平面文化遗产记录自动构建 FAIR 数字对象知识图

Automated Construction of FAIR Digital Object Knowledge Graphs from Flat Cultural Heritage Records

上下文与知识知识图谱

摘要

FAIR 数字对象 (FDO) 框架要求元数据属性值尽可能表示为持久标识符 (PID),以生成完全机器可操作的图表,其中每个引用都是可解析的。 Europea 数据模型的设计早于 FDO 规范,它将大多数元数据值存储为纯文本。这足以很好地满足人类浏览的需要,但无法让自动化代理在记录或集合中进行跟踪。我们提出了一个管道,可将平面欧洲记录转换为使用 CIDOC-CRM 构建的符合 FDO 的知识图谱。遵循 FDO 规范,我们将每个传统实体建模为具有自己的 PID、类型、配置文件和元数据层的离散 FDO。核心技术挑战是自动执行 FDO 规定的区分必须成为 PID 参考(可解析实体)的值和可能保留文字的值(注释、测量值和日期等终端叶)的值。我们使用 大语言模型 来解决这个问题,它对每个元数据值进行分类,将其路由到受控词汇表(Getty AAT、Wikidata、VIAF、PeriodO),并将其链接到共享实体 FDO。我们使用来自五个欧洲提供商的 637 份考古记录进行评估,并使用 LLM 处理每一项。该管道连接了 86% 的元数据槽,解决了 Eurona 尚未丰富的 58.5% 的价值。它还合并了字节相同匹配所分开的跨语言表面形式,其中 33 个此类合并中的 17 个在人工审核中是正确的。图连通性并不能将其与字符串匹配分开; FDO 图的区别在于每个节点都是类型化且可解析的。