多 大语言模型 精心策划的临床记录严重性评估 (MOSAIC)
Multi-Large Language Model Orchestrated Severity Assessment of Clinical Records (MOSAIC)
摘要
背景:疾病严重程度是一个多维结构,很难通过电子医疗记录 (EHR) 中基于规则的方法来捕获。 Agentic 大语言模型 (LLM) 系统可以综合 EHR 的临床证据和推理,但尚未对该任务进行评估。方法:MOSAIC 是一种用于严重性表型分析的两阶段代理 LLM 框架,使用 2 型糖尿病 (T2D) 作为概念验证。 MOSAIC 在合成队列(SyntheticMass;开放权重 N = 4,886;封闭权重 N = 200)上根据三种算法基本事实(DCSI、DiSSCo、Cooper)以及全因死亡率和事故并发症进行评估。还比较了开放式(本地可部署)和专有管道。结果:生成的框架跨越了比较器所缺少的领域,包括基于生物标志物的血糖分期、β细胞功能和健康的社会决定因素。开放式权重 MOSAIC 与专有管道相匹配(封闭式与开放式权重 kappa = 0.773),并与 Cooper (kappa = 0.597) 和 DCSI (kappa = 0.534) 达成中等协议,并与 DiSSCo (kappa = 0.320) 达成公平协议。基于药物的(类型 1)层显示全因死亡率显着分离(对数秩 p < 0.001;非基线层的粗风险比为 1.6-2.4),上层的分离是非单调的,并且事件并发症的反梯度(对数秩 p < 0.001)与易感者的消耗一致。主体分类也与同一评分标准的确定性执行不同(MOSAIC Frozen;kappa = 0.428),表明推理超出了固定规则。结论:MOSAIC 显示代理 LLM 系统可以从 T2D 结构化 EHR 数据中生成并应用具有临床意义的严重程度表型。将其扩展到具有类似多维严重程度的其他疾病值得进一步研究。