论文
使用保护隐私的合成临床数据训练 大语言模型 进行医疗编码
Training a Large Language Model for Medical Coding Using Privacy-Preserving Synthetic Clinical Data
摘要
提高医疗编码的准确性和可靠性可以减少临床医生的倦怠并支持收入周期流程,使提供商能够更多地关注患者护理。然而,由于异构记录、细致入微的编码指南和长尾分布,从临床文档中自动分配 ICD-10-CM 和 CPT 代码仍然是一个挑战。 大语言模型 已被提议用于帮助或自动化特定的医疗编码任务。然而,基础模型没有经过明确的医学编码训练,零样本编码的结果很差。我们研究现代开放权重基础模型是否可以使用来自电子健康记录的隐私保护合成训练数据来适应专家级医疗编码任务。我们根据基于 EHR 的模板和编码策略生成的临床记录和真值编码对对 Llama 3-70B 进行微调,然后评估 ICD-10-CM 和 CPT 的精确代码预测。未适应模型的零样本基线在精确代码匹配方面获得了 0.18 的 F1 分数。在合成语料库上使用 微调 后,精确匹配 F1 超过了 0.70,这代表着两个代码系统都有很大的绝对增益。值得注意的是,在通常需要多步骤临床推理和代码编写的复杂类别(包括晚期疾病和虚弱类别)上,性能仍然很高,并且该模型在医学理解任务上保留了其性能。这些结果表明,合成的策略感知数据可以有效地教导通用 大语言模型 支持精确的医疗编码,而无需暴露受保护的健康信息。该方法为在代表现实世界人群的特定任务上安全、迭代地训练 编码智能体 提供了一条实用的路径。