论文
测量基于 LLM 的结构化提取对临床出院总结中提示、模型和模式选择的敏感性
Measuring the sensitivity of LLM-based structured extraction to prompt, model, and schema choices in clinical discharge summaries
摘要
大语言模型 越来越多地用于从临床自由文本注释中进行结构化提取,但其输出对上游配置选择的敏感性比其在固定基准上的准确性更难理解。这项工作通过固定提取任务并每次改变一个选择来测量灵敏度,无需人工注释 真值。固定模式包括三向 yes/no/not_documented 值集上的 17 个临床文档标记和用于主要入院原因的 47 个标签词汇表。表达此模式的三个提示变体分别在 MIMIC-IV v3.1 放电摘要上以两种模型大小运行。交叉提示一致性通过 ICD 分层子集上的 Cohen kappa 来测量。配对的相同注释比较隔离了模型选择的影响,并且事后将三路标志折叠为二进制测试了模式对分歧的贡献。在三向标志上,两个模型达到相同的汇总交叉提示协议(中值 kappa 0.69 和 0.68);较大的模型提高了某些领域的共识,而降低了其他领域的共识,这是一种重新分配,而不是没有效果。将模式折叠为二元消除了大部分交叉提示的分歧,将其定位在缺席与沉默的区别上,而不是在发现是否存在上。在多类别准入分类中,更改模型会在近一半的笔记上重新分配主导标签,而更改提示措辞会在大约八分之一的笔记上重新分配主导标签,而较大的模型对剩余包罗万象的类别的重视要少得多(44% 到 26%)。这些模式表明,模式强加的分歧来源集中在缺席与沉默轴上,以及模型在多类分类上的提示措辞上占主导地位,这是通过用于审核人口规模部署的提取再现性的可重用方法来识别的。