论文

使用生成式AI进行Schema引导的分层信息提取与语义评估

Schema-Guided Hierarchical Information Extraction and Semantic Evaluation Using Generative AI

应用与实践行业应用

摘要

我们提出了一种基于模式的框架,用于使用生成式人工智能从非结构化文本文档中提取复杂、结构性的信息,并在自动化的语义评估过程中与金标准进行比较。该模式作为编码领域知识的信息模型,为提取层次化、嵌套信息提供统一、系统和一致的框架,包括具有可变基数属性的属性。在结果评估之后,我们使用生成式人工智能对提取值和金标准值进行语义比较,并引入一个分类器来根据特定领域的考虑对比较结果进行分类,分为精确、语义、有用或不匹配。我们能够从NICE(健康技术评估组织)发布的文档中提取12个属性中的14个,其F1分数超过90%,使用Claude Opus 3生成式人工智能模型。从文档中提取这些属性所需的时间大约是人类领域专家所需时间的30倍。此外,我们还展示了这种框架在不同生成式人工智能模型和不同HTA组织语言之间的泛化能力。