论文

大语言模型以主诉为中心,未能在序贯临床分诊中整合证据

LLMs Anchor on Chief Complaint and Fail to Integrate Evidence in Sequential Clinical Triage

模型评测模型行为与机制分析

摘要

急诊科 (ED) 的分诊是一个依次展开的顺序决策过程。用于分类使用的大型语言模型(LLM)的现有评估完成了回顾性记录和报告性能,接近于医生的性能。我们实施了一种评估连续分诊大语言模型的方法,该任务是根据护患对话中不断增长的前缀来预测分诊敏锐度标签。我们在两个语料库的五个连续检查点评估了六个大语言模型:425 个大语言模型生成(模拟)和 50 个医生撰写(临床)对话,均标记为紧急严重程度指数 (ESI)。每个模型(通过二次加权 kappa (QWK) 衡量)在每个连续检查点都会从对完整记录的中度到实质性一致性降级为一般到中度一致性。受控扰动表明,每个检查站的标签都以主要投诉交换为基础,而提示干预措施无法解除这一停滞状态。模型从后面的回合中提取临床相关内容,但真正的标签令人惊讶地跨越了检查点。因此该模型未能整合证据。三位专家临床医生在同一对话中的 QWK 达到 0.887-0.929,而最佳模型达到 0.295。预测集中在 ESI-2 和 ESI-3 上,并且模型之间的一致性高于真实情况,因此集成会加剧失败。仅根据离线基准部署用于 ED 分类的 LLM 会错过这种连续失败。