基于纵向骨髓瘤病历的智能体临床推理:对照专家共识的回顾性评估
Agentic clinical reasoning over longitudinal myeloma records: a retrospective evaluation against expert consensus
摘要
多发性骨髓瘤的治疗需要跨数年至数十年依次进行多线治疗,每一次决策都依赖于分散在数十至数百份异构临床文档中的累积病史。基于大语言模型(LLM)的系统能否在接近专家共识的水平上综合这些证据,此前尚未有定论。本研究对一家三级医疗中心(2001-2026 年)收治的 811 例骨髓瘤患者的纵向临床病历开展了回顾性评估,涵盖 44,962 份文档和 1,334,677 项实验室检查值,并在 MIMIC-IV 上进行了外部验证。在来自 48 个模板、三个复杂度级别的 469 个患者-问题对上,将一个智能体推理系统与单次检索增强生成(RAG)、迭代 RAG 以及全上下文输入进行比较。参考标签来自四位肿瘤科医生的双重标注,并由资深血液科医生裁定。迭代 RAG 与全上下文输入收敛于同一上限(75.4% 对 75.8%,p = 1.00)。智能体系统达到 79.6% 的一致率(95% CI 76.4-82.8),超过两个基线(+3.8 和 +4.2 个百分点;p = 0.006 和 0.007)。增益随问题复杂度上升而增大,在基于标准的综合任务上达到 +9.4 个百分点(p = 0.032);也随病历长度增加而增大,在最高十分位达到 +13.5 个百分点(n = 10)。系统错误率(12.2%)与专家分歧率(13.6%)相当,但严重性相反:57.8% 的系统错误具有临床意义,而专家分歧中这一比例仅为 18.8%。智能体推理是唯一超越该共同上限的方法,其增益集中在最复杂的问题和最长的病历上。残留系统错误具有更大的临床后果,这表明在这些发现转化为患者获益之前,需要在常规诊疗中进行前瞻性评估。