论文

通过查询推理和执行对知识图中的历史文档进行稳健解释

Robust Interpretation of Historical Documents in Knowledge Graphs Through Query Inference and Execution

上下文与知识知识图谱

摘要

大语言模型(LLM)的出现重新定义了用户在数字环境中与信息交互的方式。然而,它们广泛且往往不加区别的集成引起了人们对可靠性和可信度问题的严重担忧,这些问题在访问数字图书馆和历史档案时尤其重要。如何利用 LLM 的泛化能力而不失去档案机构所需的责任水平?在本文中,我们提出了一种代理检索系统,旨在提供对历史数据的更准确和可验证的访问,同时保留与不受约束的 LLM 相关的大部分灵活性。作为对历史文档分析的贡献,我们将传统检索增强生成 (RAG) 与代理 GraphRAG 架构进行比较,看它们在现实条件下(包括 OCR 和转录错误的存在)提供历史信息的能力。我们引入了一个半符号框架,它将用于 OCR 后校正的单词识别技术与知识图表示相结合,使代理能够通过综合查询访问信息。单词识别和代码生成之间的交错协作允许代理构建强大的检索查询,这些检索查询对误解和幻觉具有鲁棒性,同时在历史文档分析中常见的噪声和不确定性会阻碍精确检索时仍然利用近似搜索。