论文

使用大语言模型生成长程纵向合成临床笔记的管线

A Pipeline for Generating Longitudinal Synthetic Clinical Notes Using Large Language Models

模型训练合成数据

摘要

合成数据日益用于在真实数据访问受限的域支持AI系统的开发与评估。在医疗中——临床文档因其敏感性带来特殊挑战。本工作引入合成临床笔记管线与数据集——支持临床AI工具开发——同时避免真实患者数据的隐私风险。该数据集经模块化管线生成:组合结构化患者生成、半结构化患者旅程仿真——以及使用大语言模型的非结构化临床笔记生成。管线设计为优先保证纵向患者记录的内部一致性——同时捕捉写作风格、笔记结构与临床细节的变异。附加机制——包括基于LLM的验证与增广步骤——用于改善生成笔记的忠实性、真实性与多样性。我们发布70名合成患者的数据集——每名患者关联横跨完整住院旅程的20-50份临床笔记。数据集以多级验证提供——使用户可按用例平衡真实性与可扩展性。该数据集支持临床AI系统的开发、测试与评估——包括摘要工具、编码模型与决策支持系统——无需依赖真实患者数据。

使用大语言模型生成长程纵向合成临床笔记的管线:论文配图
图 1:我们的合成数据管道的简单概述。