论文

H2:面向医疗数据调和的双混合语义数据湖架构与人在回路验证的大语言模型元数据标注系统

H2: A Dual Hybrid Semantic Data Lake Architecture for Medical Data Harmonization with Human-In-the-Loop verified, LLM Driven Metadata Annotation System

上下文与知识知识图谱

摘要

医疗数据本质上在多个层面上表现出高度的异质性,包括(a)不同的模式,如图像、文本和时间序列,(b)机构引入的不同表格模式,以及(c)医疗保健专业人员提供的完全非结构化的文本信息数据。数据湖通常用于医疗数据存储,以将所有异构的不同数据整合到一个中央位置,可以“按原样”保存数据,而无需像数据仓库那样强加模式。尽管数据湖具有灵活性,但它还是因“数据沼泽”故障而臭名昭著。因此,通过元数据提供可靠的数据协调机制,而不损害完整性或灵活性,是一个真正的挑战。为此,知识图引起了人们的关注,因为它们提供了一种动态的方式来描述关系,而无需严格的写入模式方法。此外,另一个严格的任务依赖于数据的互操作性:在如此多样化的数据上应用适当的机器学习技术并不是一件容易的任务,因为领域专家必须决定一种方法对特定数据类型或数据集的有效性。元数据注释可以通过标记适用的操作来提供帮助,但这需要手动干预,更不用说大量缺乏此类信息的现有数据集。为了应对这两个挑战,在本文中,我们提出了一种语义数据湖架构,该架构可促进数据协调并结合非标记元数据集合的生成注释过程(即 LLM),以支持有意义的 ML 技术的应用。在此方法的基础上,我们创建了更高层次的知识,根据数据性质识别数据对于适用的机器学习操作的适用性......

H2:面向医疗数据调和的双混合语义数据湖架构与人在回路验证的大语言模型元数据标注系统:论文配图
图1:所提出的H2架构。两项主要创新被突出显示:a) H2-MMS模块引入的基于文档与读时模式(Schema-on-Read)的方法;b) H2-TGM模块实现的基于规则的语义三元组生成器与LLM驱动的元数据标注机制。后者的输出由所提出的人在回路(Human-In-the-Loop,HIL)方案进行验证。