论文

使用 LLM 生成的合成数据训练的模型进行临床通信处理:结构化调查和新颖的应用案例研究

Clinical Communication Processing with Models Trained on LLM-Generated Synthetic Data: A Structured Survey and Novel Application Case Studies

模型训练合成数据

摘要

许多临床价值不是通过结构化记录而是通过沟通来传达:患者描述症状、临床医生推理并给出指示、救护车移交给急诊科以及护士轮班的交流。这种语言不同于表格数据,因为含义取决于说话者的角色、意图、因果关系、不确定性、遗漏和渠道噪音。因此,医疗保健自然语言处理必须将信息解释为传达的而不是编码的。这需要经过良好注释的语料库,但由于真实的交流是私密的、分散的且注释成本高昂,因此语料库非常稀缺。 大语言模型 通过将记录、诊断标签、症状列表或护理计划等临床来源转换为下游模型的书面和转录通信,提供了一条前进的道路。我们提出了一个结构化的叙事调查,由来源表示、沟通形式和参与者、生成方法和下游任务组织,并辅以十三个新颖的案例研究。这些为没有标记的真实世界数据的通信渠道和语言构建临床 NLP 系统,包括 EMS 到达前报告、现场无线电伤亡记录、护士交接、患者门户分类和资源匮乏的出院通信。他们表明,综合通信可以引导此类系统。研究结果包括微调编码器模型相对于评估的零样本基线的竞争力,以及故意降低通信鲁棒性的价值。主要的局限性在于,大多数研究评估的是保留的合成通信,而合成训练、真实证据的测试仍然有限。我们的结论是,综合临床交流正在成为一种实用的研究资源;将其建立为可重复使用的临床基础设施将需要真实的数据传输、安全性和外部验证。