论文

AIPatient Arena:在端到端临床咨询工作流程中对 大语言模型 进行基于 EHR 的评估

AIPatient Arena: EHR-grounded evaluation of large language models in end-to-end clinical consultation workflows

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地被考虑用于临床咨询任务,但大多数医学评估仍然是静态的、单轮的或狭隘的基于结果的,限制了它们反映现实世界护理的顺序、不确定和交互性质的能力。在这里,我们提出了 AIPatient Arena,这是一个基于 EHR 的评估框架,用于评估 LLM 在临床能力的八个维度上的临床效用。该框架将 EHR 数据集成到患者特定的知识图中,实现多轮医患互动。我们将 AIPatient Arena 应用于 437 名患者的主要队列和 119 名和 67 名患者的两个分布外验证队列。我们观察到 LLM 在医学访谈提问技巧(QS;平均分,4.43-4.99/5)、道德和专业行为(ET;4.38-4.93/5)以及临床解释的清晰度和透明度(EX;3.80-4.72/5)方面表现良好。在信息整合(II;3.19-4.21/5)和用药安全性和合理性(MS;3.13-3.78/5)方面表现中等,但在处理模糊的患者反应(HR;2.57-3.32/5)、信息覆盖范围(IC;2.08-3.02/5)以及诊断准确性和推理(Dx;2.08-3.02/5)方面观察到持续存在的弱点。 2.63-3.55/5)。基于流程的评估揭示了反复出现的互动失败,包括重复提问、遗漏既往病史以及对不确定性处理不当。更丰富的对话环境改善了诊断推理,但在治疗计划方面取得的成果有限。这些发现表明,仅最终答案的准确性不足以评估临床准备情况,并强调评估模型如何在整个咨询过程中收集、解释和交流信息的重要性。 AIPatient Arena 提供了一个基于 EHR 的框架,用于医疗 LLM 的面向工作流程的部署前评估。