未知并不正常:将语言模型提取与基于规则的决策逻辑分开以进行临床风险评分
Unknown is not normal: separating language-model extraction from rule-based decision logic for clinical risk scores
摘要
大语言模型 (LLM) 越来越多地用于根据自由文本注释计算临床风险评分。注释通常不完整,将未记录的发现视为正常情况可能会悄悄地对患者进行错误分类。我们测试将三态提取(由LLM进行的存在、不存在或未知)与决策逻辑(未知输入上的确定性代码计算分数范围)分开,是否可以让系统只提出可以改变决策的问题。在 6 个计算器(HEART、CURB-65、qSOFA、PERC、Wells、Cockcroft-Gault)的 1,200 个综合紧急情况下,模拟临床医生回答问题,我们将这种边界策略与询问每个缺失输入、缺失等于正常模式和端到端 LLM Agent(Claude Opus 5.5)进行了比较。使用 Claude Haiku 4.5 作为提取器,边界策略与全部询问准确率(99.4% 与 99.4%)相匹配,其中一半的问题(每个案例 0.92 与 1.78),并且没有不相关的问题。将缺失视为正常情况会导致准确率下降至 91.2%,并且对 8.5% 的患者进行分类不足(95% CI 7.1-10.2),并且在混乱的笔记和吵闹的临床医生的情况下,分类不足的现象仍然存在。该Agent在理想条件下同样准确 (99.6%),但 9.5% 的问题是无关紧要的;对于吵闹的临床医生,它的准确度低于界限策略(83.5% vs 87.0%,p<0.001),并且在 2.7% 的病例中过早实施(界限:0%)。作为提取器的 9B 本地模型达到了预言机级别的准确率(99.8%)。在 MedCalc-Bench 的 584 份真实病例报告中,只有 52% 包含足够的信息来确定类别(心脏 13%)。通过明确推理未知数的代码来路由决策可以避免过早的承诺和不相关的问题,将提出的问题减半,并与小型本地模型一起使用。