论文

Few-Shot 大语言模型 用于在线患者查询的可操作分类分类

Few-Shot Large Language Models for Actionable Triage Categorization of Online Patient Inquiries

应用与实践行业应用

摘要

在线患者询问通常是非正式的、不完整的,并且是在专业评估之前编写的,但仍必须将其转至适当级别的临床随访。我们将其作为四类可操作分类任务进行研究——自我护理、安排就诊、紧急临床医生审查或紧急转诊,并询问提示的 大语言模型 (LLM) 是否可以在低资源标签条件下支持此类路由。使用公共 HealthCareMagic-100K 语料库,我们构建了一个 300 个示例的人类校准黄金评估集、一个 700 个示例的自动标记银训练集和一个 40 个示例的少样本池。我们将银标签上用于生物医学文本挖掘 (BioBERT) 基线训练的 Transformer 的术语频率-逆文档频率 (TF-IDF) 和双向编码器表示与分别在 0 次、4 次和 12 次条件下的六个提示 LLM 进行比较。因此,我们使用宏观 $F_1$ 以及安全意识指标进行评估,包括紧急召回、分类不足率和严重分类不足率。最强的 LLM(Claude Haiku 4.5,12 个镜头)达到宏观 $F_1$ 0.475,超过点估计的最佳监督基线(BioBERT,0.378),具有重叠的置信区间。少量提示和两种模型协议以依赖于标签的方式提供帮助:自我护理协议是可靠的,紧急临床医生审查则不然。我们的结论是,LLM 可以支持分类优先级和选择性人工审查,但不能支持自主部署。