论文
大语言模型出院后临床行动提取的系统评价
Systematic Evaluation of Large Language Models for Post-Discharge Clinical Action Extraction
摘要
本文的工作使用 CLIP 出院记录数据集评估零样本和少样本 大语言模型 (LLM) 的安全关键临床行动提取,特别强调护理的转变和出院后患者的安全。为了管理临床文档的复杂性,我们引入了一个两阶段提取框架,该框架通过分阶段的提示策略将以叙述形式编写的出院记录分解为细粒度、明确可操作的临床任务。我们的贡献包括对用于临床动作提取的生成式 LLM 进行系统评估、通用 LLM 和基于特定任务的监督 BERT 模型之间的详细比较,以及对不同动作类别之间注释不一致的分析。我们表明,当代 LLM 在二元可操作性检测方面实现了与监督模型相当或超过的性能,而监督基线在细粒度多标签类别分类上保留了有意义的优势,尽管缺乏特定于任务的 微调 且受到严格的数据隐私约束。定性误差分析表明,许多失败源于模型推理和数据集注释约定之间的不一致,特别是在涉及隐式临床行为和严格的结构标签规则的情况下。这些结果表明,报告的性能反映了由于缺乏临床推理而导致的模型局限性,而普通注释无法捕捉到这一点。没有基本原理的标签使得无法区分临床推理失败和注释约定不匹配。推进临床 NLP 需要带有推理注释的数据集,这些数据集记录了为什么特定跨度是可行的,而不仅仅是标记了哪些跨度,从而能够正确评估模型临床理解。