论文

提示是不够的:监督基线和泄漏控制,用于衡量儿科就诊中使用 LLM 的共同决策

Prompting is not enough: supervised baselines and leakage control for measuring shared decision-making with LLMs in pediatric encounters

模型评测模型能力评测

摘要

目标:确定 大语言模型 (LLM) 的零样本提示是否足以检测真实临床中的共享决策 (SDM) 行为,以及监督学习是否在患者分组、嵌套评估下增加价值。方法:我们分析了患有多种长期疾病的儿童家庭与其手术提供者之间的 21 次门诊手术决策录音(19 名独特患者;7,566 个话语片段;约 6.1 小时)。训练有素的编码员标记了 12 种 SDM 行为的片段(人与人的宏观 Cohen 的 kappa = 0.695)。我们比较了零样本局部 LLM (Qwen 2.5 32B),这是一个针对冻结句子嵌入的监督分类器,及其逻辑堆栈,在患者分组的外折叠下与内部交叉拟合阈值和患者重新采样的置信区间。结果:零样本 LLM 达到宏观 kappa = 0.139 (95% CI 0.111-0.164)。监督分类器达到 kappa = 0.227 (0.186-0.262),成对改进 0.088 (0.051-0.119)。两者的逻辑叠加达到 kappa = 0.242 (0.198-0.284)。我们确定了多个特定于语料库的泄漏路径,包括将同级记录分别分组,并允许来自外部保留患者的标签进入拟合下游模型时使用的少数样本。结论:单独的零样本提示不足以像小型监督模型那样可靠地测量 SDM 行为,并且当在外部评估循环之外预先计算标记的提示示例时,单独的患者级别分组并不能防止泄漏。报告的性能对数据分割的单位以及标记的样本进入管道的位置敏感。在这些发现推广到这个群体、模型、提示和密码本之外之前,需要进行外部验证。