论文

语言模型作为接口,而不是预言机:用于儿科阑尾炎的混合 LLM-ML 系统

Language Models as Interfaces, Not Oracles: A Hybrid LLM-ML System for Pediatric Appendicitis

应用与实践行业应用

摘要

大语言模型 (LLM) 可以通过解释自由文本文档来使临床决策支持更容易获得,但它们作为诊断引擎的直接使用受到对提示、信息顺序和看似合理但不正确的输出的敏感性的限制。结构化机器学习模型提供更稳定的风险预测,但它们需要难以与叙述性临床工作流程集成的表格输入。我们提出了 ClaMPAPP(阑尾炎临床语言辅助机器学习管道),这是一个混合系统,使用 LLM 作为界面而不是最终决策者。 ClaMPAPP 从类似笔记的叙述中提取模式约束的临床特征,应用确定性的合理性检查,并将经过验证的特征传递给经过临床、实验室和超声变量训练的 XGBoost 分类器。我们在来自德国医院的两个独立儿科阑尾炎队列中评估了 ClaMPAPP,并将其与端到端 LLM 基线(包括开源模型和专有模型)进行了比较。为了在测试自由文本输入时保留 真值,通过模板渲染和约束 LLM 重写从结构化电子健康记录生成叙述,并使用额外的句子顺序排列来评估位置稳健性。 ClaMPAPP 在内部和外部验证中实现了最强的整体诊断性能,同时最大限度地减少了阑尾炎漏诊病例,这是急性分诊中的关键安全问题。端到端 LLM 显示出不稳定的敏感性-特异性权衡以及叙述重新排序下更大的退化。这些结果支持 LLM 作为界面、ML 作为预测器的设计,该设计将自然语言可用性与预测推理分开,并为临床决策支持提供更可审核的途径。